Quizzman Fanqie Engine 系列 — 第 8 篇。上一篇:漢越韻母系統:十六攝
從音韻規律到實際語言:為什麼 Quizzman Fanqie Engine 仍然需要 Lexical Normalization?
如果所有漢越音都完全遵循音韻規律,那麼建立一套漢越音 Engine 將會非常簡單。只要準確重建 Middle Chinese,再套用歷史音變規則即可。然而,自然語言從來不是如此理想。超過一千年的歷史,留下了不同時期的借詞、語義演變、多音字、異讀以及各種歷史例外。因此,在完成整個音韻推導流程之後,Quizzman Fanqie Engine 還需要執行另一個重要步驟:Lexical Normalization。它負責連接音韻規律與現代漢越詞彙的歷史發展。
為什麼只有規律還不夠?
在前面的文章中,我們已經看到 Engine 能夠根據:
- 聲母
- 韻母
- 攝
- 等
- 開口與合口
- 平、上、去、入四聲
- 各種歷史音變規律
推導出一個漢越音。
如果所有漢字都完全符合這些規律,那麼整個流程就是:
反切
↓
Middle Chinese
↓
音韻規律
↓
漢越音
然而,真正的歷史並非如此。
在超過一千年的漢字使用過程中,
越南語不斷吸收、調整並重新標準化漢越讀音。
有些規律被完整保留下來。
也有不少規律在語言演變過程中被打破。
因此,
Pure Projection 並不能直接作為最終答案。
漢越音是一套仍然演化中的系統
一個常見的誤解是:
把漢越音視為唐代漢語的一張「快照」。
這只說對了一部分。
漢越音確實保存了大量 Middle Chinese 的特徵。
但在進入越南語之後,
它仍然持續發展。
數百年間,
陸續出現了:
- 新讀法
- 古讀殘留
- 地方讀音
- 不同借詞層
- 與越南語本身的同化現象
因此:
今天的漢越讀音,並不一定完全反映最初的音韻規律。
一個最簡單的例子
假設 Engine 只依照音韻規律運作。
它可能得到:
Middle Chinese
↓
Pure Projection
↓
A
然而,
歷史上的越南語卻真正採用了:
B
並且今天的詞典也是如此記錄。
這時存在兩種可能:
第一種:
Engine 推導錯誤。
第二種:
Engine 推導正確,
只是語言後來沿著另一條歷史路徑發展。
這兩種情況完全不同。
若無法區分,
修改 Engine 將十分危險。
Pure Projection 不是最終結果
在 Quizzman Fanqie Engine 中,
第一個推導結果稱為:
Pure Projection
它完全依照音韻規律產生。
不依賴:
- 詞典
- 漢越資料庫
- 常用讀音
- 使用頻率統計
Pure Projection 只回答一個問題:
如果只考慮歷史音韻規律,這個漢字應該發展成什麼樣的漢越音?
它是整套系統的重要基準。
當歷史不再遵循規律
Pure Projection 完成後,
Engine 才開始與歷史資料比對。
例如:
Pure Projection
↓
quốc
若詞典同樣記載:
quốc
那麼沒有任何問題。
但也可能出現:
Pure Projection
↓
A
而標準漢越詞彙卻記錄:
B
這時,
Engine 不會立刻修改結果。
首先要判斷:
- 是規律錯了?
- 還是歷史走向不同?
這正是 Lexical Normalization 的工作。
與詞典不同,不代表規律錯誤
Quizzman Fanqie Engine 有一項重要原則:
不同於詞典,不等於音韻規律錯誤。
例如,
同一個漢字可能同時存在:
- 文讀
- 口語讀音
- 古讀
- 新讀
- 多個借詞層
如果 Engine 強制所有結果都符合現代詞典,
那麼音韻研究的價值就會消失。
因此,
Engine 始終區分:
規律錯誤
≠
詞彙層差異
這是整個架構最重要的設計理念之一。
Lexical Normalization 做什麼?
完成 Pure Projection 後,
Engine 會開始與歷史資料比對。
流程如下:
Pure Projection
↓
資料比對
↓
評估
↓
Hybrid Result
所使用的資料包括:
- 《Thiều Chửu》
- 標準漢越詞彙資料
- 人工校訂資料
- 已驗證的歷史讀音
需要強調的是:
這些資料並不修改音韻規律。
它們只是協助 Engine,
在今日的詞彙層中,
選擇最適合的表現形式。
Candidate Ranking
有些漢字並不只有一組反切。
不同韻書可能記錄:
- 不同反切
- 不同韻部
- 不同歷史讀音
如果 Engine 直接採用第一筆資料,
準確率將明顯下降。
因此,
Quizzman Fanqie Engine 建立了 Candidate Ranking。
每個候選讀音都會根據多項因素評分,例如:
- 反切來源
- 是否符合音韻規律
- 與標準漢越詞彙的吻合程度
- 屬於古讀或現代讀
- 資料來源可信度
最後,
得分最高者成為最終結果。
Hybrid 並不是「修補錯誤」
有人認為:
Hybrid 就是 Engine 推錯,再用詞典修正。
這完全不是事實。
在 Quizzman Fanqie Engine 中:
Pure Projection
↓
歷史音韻模型
Lexical Layer
↓
實際詞彙模型
Hybrid 是這兩層資訊的結合。
它並不是補救機制。
相反地,
它正是:
- 理想音韻系統
- 真實語言歷史
兩者之間的模型化結果。
為什麼 Hybrid 更準確?
內部測試顯示:
Pure Projection 對音韻規律的描述已經相當準確。
但直接與現代標準漢越詞典相比,
仍然存在一些由歷史語言演變造成的差異。
加入 Lexical Normalization 後,
Engine 與漢越詞典的吻合率大幅提高,
同時底層音韻規律完全保持不變。
這也反映出漢越音真正的本質:
它不只是音韻規律的結果,
也是超過一千年語言使用與標準化的成果。
四種可信度指標
Quizzman Fanqie Engine 的另一個特色是:
每個結果都附帶多種可信度評估。
Engine 不只回傳一個讀音,
也同時說明每一層處理的可信程度。
例如:
- Source Confidence:反切及資料來源的可信度
- Phonological Confidence:符合音韻規律的程度
- Lexical Confidence:與已驗證漢越詞彙的吻合程度
- Final Confidence:整體綜合評估結果
因此,
使用者不僅知道 Engine 如何讀,
更知道:
為什麼 Engine 會做出這樣的選擇。
不只是一本詞典,而是一套推理系統
Quizzman Fanqie Engine 最大的特色,
並不在於支援多少漢字。
真正的差異,
在於它的設計理念。
傳統詞典只保存最終答案。
Quizzman Fanqie Engine 則保存:
整個產生答案的推理過程。
因此,
系統能夠區分:
- 音韻規律
- 詞彙層
- 歷史例外
- 文讀變體
- 資料錯誤
正因如此,
Engine 不只是漢越音查詢工具,
更是一套能夠解釋、驗證每一個推導結果的歷史音韻研究平台。
下一篇
至此,我們已經了解整個流程:
從反切、
到 Middle Chinese 重建、
再到漢越音推導,
以及最後的 Lexical Normalization。
下一篇文章將探討 Quizzman Fanqie Engine 的準確率,
介紹系統如何利用數千個漢字進行 Benchmark、評估 Pure Projection 與 Hybrid 的表現,以及為什麼音韻引擎的評估方式不能只依賴傳統詞典那種「對/錯」的標準。