Quizzman Fanqie Engine 系列(第十一篇)
上一篇:為什麼 Quizzman Fanqie Engine 不是一本漢越字典?
Quizzman Fanqie Engine 的發展歷程:從查詢工具到歷史音韻推論平台
Quizzman Fanqie Engine 並非一蹴而就,而是多年反切研究、漢越音研究與中古漢語研究累積的成果。隨著研究不斷深入,Engine 的整體架構也歷經多次重大改版。每一個版本都解決了新的問題,突破前一代的限制,使系統一步步朝著最初的目標邁進:以演算法建模漢越音的形成過程,而不是將結果儲存成一本大型字典。
最初的目標
Quizzman Fanqie Engine 最初的想法其實非常單純。
是否能僅憑反切,就推導出漢越音?
乍看之下,
這似乎只是個查詢問題。
只需要:
- 擷取聲母。
- 擷取韻母。
- 將兩者組合。
然而,
真正開始實作後,
很快便遇到一個重大挑戰。
反切所包含的資訊,
遠遠不只有:
- 聲母。
- 韻母。
還包括:
- 攝。
- 等。
- 開口/合口。
- 平、上、去、入四聲。
- 越南語歷史音變。
- 多個漢越音層次。
因此,
問題的複雜度遠超過最初的想像。
第一個版本
最初的版本,
主要聚焦於最基本的能力:
- 解析反切。
- 分離聲母。
- 分離韻母。
- 產生漢越音。
這是一個概念驗證(Proof of Concept)的階段。
Engine 已經能處理不少基本反切。
然而,
例外情況仍然很多。
音韻規律尚未完整建模,
許多結果仍需依賴額外資料修正。
當資料越來越多
隨著反切資料與漢越音資料快速增加,
團隊開始面臨一個重要問題:
應該繼續累積資料,還是回頭完善規律?
這項決策,
直接影響了之後整個架構。
若持續累積資料,
Engine 最終會變成一本大型字典。
若回頭建立規律,
開發速度雖然較慢,
卻能大幅提升推論能力。
Quizzman 最終選擇了後者。
從 Data-driven 轉向 Rule-driven
這是整個專案最大的轉折點。
過去,
Engine 記錄的是:
字 A
↓
讀音 A
字 B
↓
讀音 B
之後,
改為保存:
規律 A
規律 B
規律 C
每一條規律,
都能套用到數百甚至數千個漢字。
也正是在這個階段,
Pure Projection 的概念逐漸形成。
將 Middle Chinese 獨立成一層
另一項重大變革,
是將 Middle Chinese(中古漢語) 抽離成獨立的中介層。
最初,
中古音重建與漢越音推導同時進行。
這使得系統:
- 難以測試。
- 難以擴充。
- 難以解釋。
重新設計後,
整體架構變為:
反切
↓
Middle Chinese
↓
漢越音
這樣的分層帶來許多好處:
- 每個階段都能獨立測試。
- 更容易替換中古音重建模型。
- 更容易加入拼音推導。
- 更容易支援其他漢字讀音系統。
這也成為今日整個架構的核心。
將音韻規律與詞彙層分離
後續版本最重要的改動之一,
就是徹底區分:
音韻規律
與:
詞彙層
兩者回答的是完全不同的問題。
音韻規律回答:
一個音節依照歷史規律應如何演變?
詞彙層則回答:
現代越南語實際使用哪一種讀法?
若將兩者混在一起,
Engine 將難以維護。
因此,
Quizzman Fanqie Engine 將它們拆分成兩個獨立步驟:
Pure Projection
↓
Lexical Normalization
這也是整個架構最關鍵的設計之一。
聲調系統重新設計
聲調演算法,
也是改動最大的模組之一。
最初,
Engine 直接處理:
- 平(ngang)
- 玄(huyền)
- 問(hỏi)
- 跌(ngã)
- 銳(sắc)
- 重(nặng)
雖然可正常運作,
但逐漸暴露不少限制。
經過對漢越音與 Nguyễn Tài Cẩn 研究成果的整理後,
Engine 改採 Eight Tone Slot 模型。
先處理:
- 陰平
- 陽平
- 陰上
- 陽上
- 陰去
- 陽去
- 陰入
- 陽入
最後再映射為現代越南語六聲。
如此一來,
整個推導過程都能保留完整的歷史音韻資訊。
Candidate Ranking
當反切資料逐漸完善後,
新的問題也隨之出現。
許多漢字同時具有:
- 多種反切。
- 多個文獻來源。
- 多種重建方案。
若任意選取其中一種,
結果便容易不穩定。
因此,
Quizzman Fanqie Engine 加入了 Candidate Ranking。
系統會根據多項指標評估每個候選結果,例如:
- 文獻來源品質。
- 是否符合音韻規律。
- 標準漢越音層。
- 使用普遍程度。
- 整體可信度。
如此一來,
Engine 能在保留所有候選方案的同時,
選出最合適的結果。
Confidence Score
隨著 Engine 越來越複雜,
另一個問題也浮現:
使用者如何知道哪個結果比較可信?
因此,
Engine 不再只回傳單一答案,
而加入多層 Confidence Score。
例如:
- Source Confidence
- Phonological Confidence
- Lexical Confidence
- Final Confidence
每項指標,
分別反映推論流程中的不同面向。
這也是 Engine 邁向可驗證系統的重要一步。
測試系統也同步演進
架構越龐大,
Regression(回歸錯誤)的風險也越高。
一條音韻規律的小修改,
可能影響數千個漢字。
因此,
後續版本加入了完整測試流程:
- Golden Fixture
- Batch Audit
- Regression Test
- Stress Test
- Tone Audit
- Candidate Audit
目的不只是找出新的錯誤,
更重要的是:
確保已經正確的規律,不會在未來版本中被破壞。
從漢越音 Engine 到共用平台
最初,
Quizzman Fanqie Engine 的目標,
只是推導漢越音。
然而,
當 Middle Chinese 成為獨立中介層後,
整個平台便具備更高的擴充能力。
同一份 Middle Chinese Profile,
可以同時用於:
- 漢越音推導。
- 拼音生成。
- 反切研究。
- 自然語言處理(NLP)。
- 字典系統。
因此,
Quizzman Fanqie Engine 已從單一工具,
逐步發展為多項應用共享的基礎平台。
V6:從「查詢」走向「推論」
V6 是整個架構的重要里程碑。
它不只是新增更多音韻規律,
更完整落實了整個設計理念:
- Middle Chinese 作為獨立中介層。
- 音韻規律與詞彙層彼此獨立。
- 完整建模 Eight Tone Slot。
- Candidate Ranking 選擇最佳候選結果。
- Confidence Score 評估每一步推論。
- 明確區分 Pure Projection 與 Hybrid。
因此,
Quizzman Fanqie Engine 已不再只是漢越音轉換程式,
而是真正的 Historical Phonology Inference Engine。
發展仍在持續
雖然目前架構已相當成熟,
Quizzman Fanqie Engine 的發展並未停止。
歷史音韻學仍有極大的研究空間。
未來,
同一套 Middle Chinese 平台,
還可支援:
- 漢日音(Kan-on、Go-on)。
- 漢韓音。
- 漢語各地方言。
- 多個歷史音層重建。
- 漢文 NLP 與 AI 應用。
這也是 Quizzman 長期努力的方向:
不只是打造一套漢越音查詢工具,而是建立一個面向東亞歷史語言研究的音韻計算平台。