從音韻規律到實際語言:為什麼 Quizzman Fanqie Engine 仍然需要 Lexical Normalization?

Quizzman Fanqie Engine 系列 — 第 8 篇。上一篇:漢越韻母系統:十六攝

從音韻規律到實際語言:為什麼 Quizzman Fanqie Engine 仍然需要 Lexical Normalization?

如果所有漢越音都完全遵循音韻規律,那麼建立一套漢越音 Engine 將會非常簡單。只要準確重建 Middle Chinese,再套用歷史音變規則即可。然而,自然語言從來不是如此理想。超過一千年的歷史,留下了不同時期的借詞、語義演變、多音字、異讀以及各種歷史例外。因此,在完成整個音韻推導流程之後,Quizzman Fanqie Engine 還需要執行另一個重要步驟:Lexical Normalization。它負責連接音韻規律與現代漢越詞彙的歷史發展。

為什麼只有規律還不夠?

在前面的文章中,我們已經看到 Engine 能夠根據:

  • 聲母
  • 韻母
  • 開口與合口
  • 平、上、去、入四聲
  • 各種歷史音變規律

推導出一個漢越音。

如果所有漢字都完全符合這些規律,那麼整個流程就是:

反切
    ↓
Middle Chinese
    ↓
音韻規律
    ↓
漢越音

然而,真正的歷史並非如此。

在超過一千年的漢字使用過程中,

越南語不斷吸收、調整並重新標準化漢越讀音。

有些規律被完整保留下來。

也有不少規律在語言演變過程中被打破。

因此,

Pure Projection 並不能直接作為最終答案。


漢越音是一套仍然演化中的系統

一個常見的誤解是:

把漢越音視為唐代漢語的一張「快照」。

這只說對了一部分。

漢越音確實保存了大量 Middle Chinese 的特徵。

但在進入越南語之後,

它仍然持續發展。

數百年間,

陸續出現了:

  • 新讀法
  • 古讀殘留
  • 地方讀音
  • 不同借詞層
  • 與越南語本身的同化現象

因此:

今天的漢越讀音,並不一定完全反映最初的音韻規律。


一個最簡單的例子

假設 Engine 只依照音韻規律運作。

它可能得到:

Middle Chinese
        ↓
Pure Projection
        ↓
A

然而,

歷史上的越南語卻真正採用了:

B

並且今天的詞典也是如此記錄。

這時存在兩種可能:

第一種:

Engine 推導錯誤。

第二種:

Engine 推導正確,

只是語言後來沿著另一條歷史路徑發展。

這兩種情況完全不同。

若無法區分,

修改 Engine 將十分危險。


Pure Projection 不是最終結果

在 Quizzman Fanqie Engine 中,

第一個推導結果稱為:

Pure Projection

它完全依照音韻規律產生。

不依賴:

  • 詞典
  • 漢越資料庫
  • 常用讀音
  • 使用頻率統計

Pure Projection 只回答一個問題:

如果只考慮歷史音韻規律,這個漢字應該發展成什麼樣的漢越音?

它是整套系統的重要基準。


當歷史不再遵循規律

Pure Projection 完成後,

Engine 才開始與歷史資料比對。

例如:

Pure Projection
        ↓
      quốc

若詞典同樣記載:

quốc

那麼沒有任何問題。

但也可能出現:

Pure Projection
        ↓
A

而標準漢越詞彙卻記錄:

B

這時,

Engine 不會立刻修改結果。

首先要判斷:

  • 是規律錯了?
  • 還是歷史走向不同?

這正是 Lexical Normalization 的工作。


與詞典不同,不代表規律錯誤

Quizzman Fanqie Engine 有一項重要原則:

不同於詞典,不等於音韻規律錯誤。

例如,

同一個漢字可能同時存在:

  • 文讀
  • 口語讀音
  • 古讀
  • 新讀
  • 多個借詞層

如果 Engine 強制所有結果都符合現代詞典,

那麼音韻研究的價值就會消失。

因此,

Engine 始終區分:

規律錯誤
      ≠
詞彙層差異

這是整個架構最重要的設計理念之一。


Lexical Normalization 做什麼?

完成 Pure Projection 後,

Engine 會開始與歷史資料比對。

流程如下:

Pure Projection
        ↓
資料比對
        ↓
評估
        ↓
Hybrid Result

所使用的資料包括:

  • 《Thiều Chửu》
  • 標準漢越詞彙資料
  • 人工校訂資料
  • 已驗證的歷史讀音

需要強調的是:

這些資料並不修改音韻規律。

它們只是協助 Engine,

在今日的詞彙層中,

選擇最適合的表現形式。


Candidate Ranking

有些漢字並不只有一組反切。

不同韻書可能記錄:

  • 不同反切
  • 不同韻部
  • 不同歷史讀音

如果 Engine 直接採用第一筆資料,

準確率將明顯下降。

因此,

Quizzman Fanqie Engine 建立了 Candidate Ranking

每個候選讀音都會根據多項因素評分,例如:

  • 反切來源
  • 是否符合音韻規律
  • 與標準漢越詞彙的吻合程度
  • 屬於古讀或現代讀
  • 資料來源可信度

最後,

得分最高者成為最終結果。


Hybrid 並不是「修補錯誤」

有人認為:

Hybrid 就是 Engine 推錯,再用詞典修正。

這完全不是事實。

在 Quizzman Fanqie Engine 中:

Pure Projection
        ↓
歷史音韻模型
Lexical Layer
        ↓
實際詞彙模型

Hybrid 是這兩層資訊的結合。

它並不是補救機制。

相反地,

它正是:

  • 理想音韻系統
  • 真實語言歷史

兩者之間的模型化結果。


為什麼 Hybrid 更準確?

內部測試顯示:

Pure Projection 對音韻規律的描述已經相當準確。

但直接與現代標準漢越詞典相比,

仍然存在一些由歷史語言演變造成的差異。

加入 Lexical Normalization 後,

Engine 與漢越詞典的吻合率大幅提高,

同時底層音韻規律完全保持不變。

這也反映出漢越音真正的本質:

它不只是音韻規律的結果,

也是超過一千年語言使用與標準化的成果。


四種可信度指標

Quizzman Fanqie Engine 的另一個特色是:

每個結果都附帶多種可信度評估。

Engine 不只回傳一個讀音,

也同時說明每一層處理的可信程度。

例如:

  • Source Confidence:反切及資料來源的可信度
  • Phonological Confidence:符合音韻規律的程度
  • Lexical Confidence:與已驗證漢越詞彙的吻合程度
  • Final Confidence:整體綜合評估結果

因此,

使用者不僅知道 Engine 如何讀,

更知道:

為什麼 Engine 會做出這樣的選擇。


不只是一本詞典,而是一套推理系統

Quizzman Fanqie Engine 最大的特色,

並不在於支援多少漢字。

真正的差異,

在於它的設計理念。

傳統詞典只保存最終答案。

Quizzman Fanqie Engine 則保存:

整個產生答案的推理過程。

因此,

系統能夠區分:

  • 音韻規律
  • 詞彙層
  • 歷史例外
  • 文讀變體
  • 資料錯誤

正因如此,

Engine 不只是漢越音查詢工具,

更是一套能夠解釋、驗證每一個推導結果的歷史音韻研究平台。


下一篇

至此,我們已經了解整個流程:

從反切、

到 Middle Chinese 重建、

再到漢越音推導,

以及最後的 Lexical Normalization。

下一篇文章將探討 Quizzman Fanqie Engine 的準確率

介紹系統如何利用數千個漢字進行 Benchmark、評估 Pure Projection 與 Hybrid 的表現,以及為什麼音韻引擎的評估方式不能只依賴傳統詞典那種「對/錯」的標準。