漢越音推導演算法:從聲母、韻母到現代漢越音系統

系列:Quizzman Fanqie Engine(反切引擎)第 5 篇。上一篇:〈中古漢語重建:Quizzman Fanqie Engine 的核心〉

漢越音推導演算法:從聲母、韻母到現代漢越音系統

Quizzman Fanqie Engine(反切引擎)的特色,不在於查詢某個漢越音,而在於推導漢越音。完成 Middle Chinese(中古漢語) 音系重建後,Engine(引擎)便開始模擬一千多年來的歷史音變,逐步形成今日的漢越音。這是整個 Pipeline(處理流程)中最複雜的一個階段,也是歷史語言學、音韻學與演算法交會的核心。


從 Middle Chinese 到漢越音

完成 Middle Chinese(中古漢語)的重建後,Engine 已經掌握一個中古音節的完整音系資訊。

例如:

| 項目 | 值 | |------|----| | 聲母 | 見母 | | 韻 | 庚韻 | | 攝 | 梗攝 | | 等 | 二等 | | 開合 | 開口 | | 聲調 | 平聲 |

這仍然不是漢越音。

它只是中古漢語音節的「音系藍圖」。

接下來,Quizzman Fanqie Engine 要回答的是:

如果八、九世紀的越南人接受了這個中古音節,它最終會發展成什麼樣的漢越音?

這就是 Sino-Vietnamese Projection(漢越音投射)


並不存在一張簡單的對照表

許多人以為,中古漢語轉成漢越音,只需要一張對照表即可。

例如:

見
↓

k

東
↓

ông

實際上,只有極少數情況可以如此簡化。

一個漢越音並非由單一因素決定,而是許多音韻規律共同作用的結果。

例如,聲母除了受到本身影響之外,還受到:

  • 開口或合口
  • 韻部特性
  • 歷史音變
  • 借詞層次

等因素共同影響。

韻母、韻尾以及聲調亦是如此。

因此,Quizzman Fanqie Engine 並不使用固定對照表,而是依照歷史音變順序,逐步套用各項音韻規則。


第一階段:決定聲母

聲母是最先處理的部分。

在中國音韻學中,聲母代表音節開頭的子音。

例如:

| 聲母 | 常見對應 | |------|----------| | 幫 | b | | 滂 | ph | | 並 | b | | 明 | m | | 端 | đ | | 定 | đ | | 泥 | n | | 來 | l | | 見 | c、k | | 溪 | kh | | 群 | qu、c | | 曉 | h |

這些只是整體趨勢。

例如,同樣都是 見母,最後仍可能演變成:

  • c
  • k
  • gi

不同結果取決於後續的音韻環境。

因此,聲母不能獨立判定。


韻母決定音節主體

若聲母決定子音,韻母便決定整個音節的大部分結構。

一個韻母通常包含:

  • 主要母音
  • 介音
  • 韻尾

許多情況下,更會影響整個音節的發展方向。

例如:

| 中古韻 | 漢越音 | |--------|---------| | 東韻 | ông | | 青韻 | anh | | 魚韻 | ư |

這些並不是彼此獨立的規則。

每一個韻都屬於某一個,真正決定長期演變方向的是攝,而不是單一韻。


攝的重要性

中古音韻學把各韻分成不同的

例如:

  • 通攝
  • 江攝
  • 止攝
  • 遇攝
  • 蟹攝
  • 臻攝
  • 山攝
  • 效攝
  • 果攝
  • 假攝
  • 宕攝
  • 梗攝
  • 曾攝
  • 流攝
  • 深攝
  • 咸攝

對 Quizzman Fanqie Engine 而言,攝是推導漢越韻的重要訊號。

例如:

  • 通攝的入聲通常保留 -c 韻尾。
  • 流攝常演變為 -âu-ưu-u
  • 梗攝與曾攝常依條件演變為 -anh-inh-eng

這些規則是在整個音系層級套用,而不是針對個別漢字。


等與開合

另外兩個極為重要的因素,是等(等第)開合(開口/合口)

等(Division,等)

等反映母音與介音的位置特徵。

同一個韻,在不同等次下,可能發展出不同的漢越音。

例如:

介音是否出現,以及母音如何演變,都可能受到等的影響。


開口與合口

中古音節可分為:

  • 開口
  • 合口

它直接影響:

  • 是否出現 u 介音
  • 母音變化
  • 某些情況下的聲母演變

忽略開合,往往會導致整個漢越音推導錯誤。


入聲與韻尾

漢越音的一大特色,是保留了中古漢語的大量入聲韻尾。

例如:

| Middle Chinese(中古漢語) | 漢越音 | |----------------------------|---------| | -p | -p | | -t | -t | | -k | -c/-ch |

因此,漢越音保留了許多普通話已經失去的歷史特徵。

例如:

| 漢字 | 普通話 | 漢越音 | |------|--------|---------| | 國 | guó | quốc | | 法 | fǎ | pháp | | 德 | dé | đức | | 學 | xué | học |

在 Quizzman Fanqie Engine 中,入聲不只決定聲調,同時也決定整個韻尾結構。


聲調並不只有六聲

很多人認為,引擎只需決定:

  • 陰平
  • 陽平
  • 問聲
  • 跌聲
  • 去聲
  • 重聲

事實上,Quizzman Fanqie Engine 內部首先建立的是 Eight Tone Slot(八聲位模型)

包括:

  • 陰平
  • 陽平
  • 陰上
  • 陽上
  • 陰去
  • 陽去
  • 陰入
  • 陽入

之後才映射到現代越南語的六個聲調。

如此可保留完整的歷史音韻資訊。


規律優先,例外其次

Quizzman Fanqie Engine 的核心原則是:

不要用例外建立規律。

整個流程依序進行:

Middle Chinese
        │
        ▼
音韻規律
        │
        ▼
Pure Projection(純規律推導)
        │
        ▼
詞彙比對
        │
        ▼
歷史例外

因此,引擎即使遇到字典中不存在的漢字,也能依照規律完成推導。

若反過來先依賴例外,整個系統最終只會變成難以維護的大型對照表。


Pure Projection(純規律推導)

完成全部音韻規則後,引擎首先產生第一個推導結果。

這就是 Pure Projection(純規律推導)

其特點包括:

  • 完全不依賴字典
  • 不依賴《Thiều Chửu(Thiều Chửu 漢越字典)》
  • 不考慮讀音普及程度
  • 只反映音韻規律本身

Pure Projection 描述的是:

如果只考慮歷史音變規律,這個漢字理論上應該發展成什麼漢越音?

它也是區分規律與歷史例外的重要基礎。


從規律走向詞彙層

自然語言從來不是完全理想化的。

一千多年來,許多漢字經歷了:

  • 語義變化
  • 讀音變化
  • 多層借詞
  • 地區差異
  • 詞彙化(Lexicalization,詞彙化)

因此,在 Pure Projection 完成之後,Quizzman Fanqie Engine 才進入 Lexical Normalization(詞彙正規化)

在這個階段,引擎會比對經過驗證的漢越文獻,評估多個候選結果,再選出最適合的讀音。

重要的是:

Lexical Normalization 不會修改音韻規律,只決定規律在歷史詞彙中的實際呈現方式。


模擬歷史,而不是記憶資料

Quizzman Fanqie Engine 最大的特色,不是能處理多少漢字。

真正不同的是,它如何理解整個問題。

對一般查詢系統而言,每個漢字都是一筆獨立資料。

對 Quizzman Fanqie Engine 而言,每個漢字只是同一套歷史音韻規律的一個具體實例。

與其記住數萬筆結果,引擎更重視重現產生這些結果的歷史過程。

因此,它不僅能應用於漢越音推導,也能延伸到歷史音韻研究、自然語言處理(Natural Language Processing,自然語言處理)以及其他以歷史語言學為基礎的計算應用。


下一篇

下一篇將介紹整個系統中最複雜的部分之一:

漢越聲調演算法

內容將說明如何從中古漢語四聲建立 Eight Tone Slot(八聲位模型),以及清濁聲母如何影響聲調分化,最終形成現代越南語六聲系統。