Quizzman Fanqie Engine 的發展歷程:從查詢工具到歷史音韻推論平台

Quizzman Fanqie Engine 系列(第十一篇)

上一篇:為什麼 Quizzman Fanqie Engine 不是一本漢越字典?

Quizzman Fanqie Engine 的發展歷程:從查詢工具到歷史音韻推論平台

Quizzman Fanqie Engine 並非一蹴而就,而是多年反切研究、漢越音研究與中古漢語研究累積的成果。隨著研究不斷深入,Engine 的整體架構也歷經多次重大改版。每一個版本都解決了新的問題,突破前一代的限制,使系統一步步朝著最初的目標邁進:以演算法建模漢越音的形成過程,而不是將結果儲存成一本大型字典。

最初的目標

Quizzman Fanqie Engine 最初的想法其實非常單純。

是否能僅憑反切,就推導出漢越音?

乍看之下,

這似乎只是個查詢問題。

只需要:

  • 擷取聲母。
  • 擷取韻母。
  • 將兩者組合。

然而,

真正開始實作後,

很快便遇到一個重大挑戰。

反切所包含的資訊,

遠遠不只有:

  • 聲母。
  • 韻母。

還包括:

  • 攝。
  • 等。
  • 開口/合口。
  • 平、上、去、入四聲。
  • 越南語歷史音變。
  • 多個漢越音層次。

因此,

問題的複雜度遠超過最初的想像。

第一個版本

最初的版本,

主要聚焦於最基本的能力:

  • 解析反切。
  • 分離聲母。
  • 分離韻母。
  • 產生漢越音。

這是一個概念驗證(Proof of Concept)的階段。

Engine 已經能處理不少基本反切。

然而,

例外情況仍然很多。

音韻規律尚未完整建模,

許多結果仍需依賴額外資料修正。

當資料越來越多

隨著反切資料與漢越音資料快速增加,

團隊開始面臨一個重要問題:

應該繼續累積資料,還是回頭完善規律?

這項決策,

直接影響了之後整個架構。

若持續累積資料,

Engine 最終會變成一本大型字典。

若回頭建立規律,

開發速度雖然較慢,

卻能大幅提升推論能力。

Quizzman 最終選擇了後者。

從 Data-driven 轉向 Rule-driven

這是整個專案最大的轉折點。

過去,

Engine 記錄的是:

字 A
 ↓
讀音 A

字 B
 ↓
讀音 B

之後,

改為保存:

規律 A
規律 B
規律 C

每一條規律,

都能套用到數百甚至數千個漢字。

也正是在這個階段,

Pure Projection 的概念逐漸形成。

將 Middle Chinese 獨立成一層

另一項重大變革,

是將 Middle Chinese(中古漢語) 抽離成獨立的中介層。

最初,

中古音重建與漢越音推導同時進行。

這使得系統:

  • 難以測試。
  • 難以擴充。
  • 難以解釋。

重新設計後,

整體架構變為:

反切
    ↓
Middle Chinese
    ↓
漢越音

這樣的分層帶來許多好處:

  • 每個階段都能獨立測試。
  • 更容易替換中古音重建模型。
  • 更容易加入拼音推導。
  • 更容易支援其他漢字讀音系統。

這也成為今日整個架構的核心。

將音韻規律與詞彙層分離

後續版本最重要的改動之一,

就是徹底區分:

音韻規律

與:

詞彙層

兩者回答的是完全不同的問題。

音韻規律回答:

一個音節依照歷史規律應如何演變?

詞彙層則回答:

現代越南語實際使用哪一種讀法?

若將兩者混在一起,

Engine 將難以維護。

因此,

Quizzman Fanqie Engine 將它們拆分成兩個獨立步驟:

Pure Projection
        ↓
Lexical Normalization

這也是整個架構最關鍵的設計之一。

聲調系統重新設計

聲調演算法,

也是改動最大的模組之一。

最初,

Engine 直接處理:

  • 平(ngang)
  • 玄(huyền)
  • 問(hỏi)
  • 跌(ngã)
  • 銳(sắc)
  • 重(nặng)

雖然可正常運作,

但逐漸暴露不少限制。

經過對漢越音與 Nguyễn Tài Cẩn 研究成果的整理後,

Engine 改採 Eight Tone Slot 模型。

先處理:

  • 陰平
  • 陽平
  • 陰上
  • 陽上
  • 陰去
  • 陽去
  • 陰入
  • 陽入

最後再映射為現代越南語六聲。

如此一來,

整個推導過程都能保留完整的歷史音韻資訊。

Candidate Ranking

當反切資料逐漸完善後,

新的問題也隨之出現。

許多漢字同時具有:

  • 多種反切。
  • 多個文獻來源。
  • 多種重建方案。

若任意選取其中一種,

結果便容易不穩定。

因此,

Quizzman Fanqie Engine 加入了 Candidate Ranking

系統會根據多項指標評估每個候選結果,例如:

  • 文獻來源品質。
  • 是否符合音韻規律。
  • 標準漢越音層。
  • 使用普遍程度。
  • 整體可信度。

如此一來,

Engine 能在保留所有候選方案的同時,

選出最合適的結果。

Confidence Score

隨著 Engine 越來越複雜,

另一個問題也浮現:

使用者如何知道哪個結果比較可信?

因此,

Engine 不再只回傳單一答案,

而加入多層 Confidence Score

例如:

  • Source Confidence
  • Phonological Confidence
  • Lexical Confidence
  • Final Confidence

每項指標,

分別反映推論流程中的不同面向。

這也是 Engine 邁向可驗證系統的重要一步。

測試系統也同步演進

架構越龐大,

Regression(回歸錯誤)的風險也越高。

一條音韻規律的小修改,

可能影響數千個漢字。

因此,

後續版本加入了完整測試流程:

  • Golden Fixture
  • Batch Audit
  • Regression Test
  • Stress Test
  • Tone Audit
  • Candidate Audit

目的不只是找出新的錯誤,

更重要的是:

確保已經正確的規律,不會在未來版本中被破壞。

從漢越音 Engine 到共用平台

最初,

Quizzman Fanqie Engine 的目標,

只是推導漢越音。

然而,

當 Middle Chinese 成為獨立中介層後,

整個平台便具備更高的擴充能力。

同一份 Middle Chinese Profile,

可以同時用於:

  • 漢越音推導。
  • 拼音生成。
  • 反切研究。
  • 自然語言處理(NLP)。
  • 字典系統。

因此,

Quizzman Fanqie Engine 已從單一工具,

逐步發展為多項應用共享的基礎平台。

V6:從「查詢」走向「推論」

V6 是整個架構的重要里程碑。

它不只是新增更多音韻規律,

更完整落實了整個設計理念:

  • Middle Chinese 作為獨立中介層。
  • 音韻規律與詞彙層彼此獨立。
  • 完整建模 Eight Tone Slot。
  • Candidate Ranking 選擇最佳候選結果。
  • Confidence Score 評估每一步推論。
  • 明確區分 Pure Projection 與 Hybrid。

因此,

Quizzman Fanqie Engine 已不再只是漢越音轉換程式,

而是真正的 Historical Phonology Inference Engine

發展仍在持續

雖然目前架構已相當成熟,

Quizzman Fanqie Engine 的發展並未停止。

歷史音韻學仍有極大的研究空間。

未來,

同一套 Middle Chinese 平台,

還可支援:

  • 漢日音(Kan-on、Go-on)。
  • 漢韓音。
  • 漢語各地方言。
  • 多個歷史音層重建。
  • 漢文 NLP 與 AI 應用。

這也是 Quizzman 長期努力的方向:

不只是打造一套漢越音查詢工具,而是建立一個面向東亞歷史語言研究的音韻計算平台。