系列:Quizzman Fanqie Engine(反切引擎)第 5 篇。上一篇:〈中古漢語重建:Quizzman Fanqie Engine 的核心〉。
漢越音推導演算法:從聲母、韻母到現代漢越音系統
Quizzman Fanqie Engine(反切引擎)的特色,不在於查詢某個漢越音,而在於推導漢越音。完成 Middle Chinese(中古漢語) 音系重建後,Engine(引擎)便開始模擬一千多年來的歷史音變,逐步形成今日的漢越音。這是整個 Pipeline(處理流程)中最複雜的一個階段,也是歷史語言學、音韻學與演算法交會的核心。
從 Middle Chinese 到漢越音
完成 Middle Chinese(中古漢語)的重建後,Engine 已經掌握一個中古音節的完整音系資訊。
例如:
| 項目 | 值 | |------|----| | 聲母 | 見母 | | 韻 | 庚韻 | | 攝 | 梗攝 | | 等 | 二等 | | 開合 | 開口 | | 聲調 | 平聲 |
這仍然不是漢越音。
它只是中古漢語音節的「音系藍圖」。
接下來,Quizzman Fanqie Engine 要回答的是:
如果八、九世紀的越南人接受了這個中古音節,它最終會發展成什麼樣的漢越音?
這就是 Sino-Vietnamese Projection(漢越音投射)。
並不存在一張簡單的對照表
許多人以為,中古漢語轉成漢越音,只需要一張對照表即可。
例如:
見
↓
k
或
東
↓
ông
實際上,只有極少數情況可以如此簡化。
一個漢越音並非由單一因素決定,而是許多音韻規律共同作用的結果。
例如,聲母除了受到本身影響之外,還受到:
- 等
- 開口或合口
- 韻部特性
- 歷史音變
- 借詞層次
等因素共同影響。
韻母、韻尾以及聲調亦是如此。
因此,Quizzman Fanqie Engine 並不使用固定對照表,而是依照歷史音變順序,逐步套用各項音韻規則。
第一階段:決定聲母
聲母是最先處理的部分。
在中國音韻學中,聲母代表音節開頭的子音。
例如:
| 聲母 | 常見對應 | |------|----------| | 幫 | b | | 滂 | ph | | 並 | b | | 明 | m | | 端 | đ | | 定 | đ | | 泥 | n | | 來 | l | | 見 | c、k | | 溪 | kh | | 群 | qu、c | | 曉 | h |
這些只是整體趨勢。
例如,同樣都是 見母,最後仍可能演變成:
- c
- k
- gi
不同結果取決於後續的音韻環境。
因此,聲母不能獨立判定。
韻母決定音節主體
若聲母決定子音,韻母便決定整個音節的大部分結構。
一個韻母通常包含:
- 主要母音
- 介音
- 韻尾
許多情況下,更會影響整個音節的發展方向。
例如:
| 中古韻 | 漢越音 | |--------|---------| | 東韻 | ông | | 青韻 | anh | | 魚韻 | ư |
這些並不是彼此獨立的規則。
每一個韻都屬於某一個攝,真正決定長期演變方向的是攝,而不是單一韻。
攝的重要性
中古音韻學把各韻分成不同的攝。
例如:
- 通攝
- 江攝
- 止攝
- 遇攝
- 蟹攝
- 臻攝
- 山攝
- 效攝
- 果攝
- 假攝
- 宕攝
- 梗攝
- 曾攝
- 流攝
- 深攝
- 咸攝
對 Quizzman Fanqie Engine 而言,攝是推導漢越韻的重要訊號。
例如:
- 通攝的入聲通常保留 -c 韻尾。
- 流攝常演變為 -âu、-ưu 或 -u。
- 梗攝與曾攝常依條件演變為 -anh、-inh 或 -eng。
這些規則是在整個音系層級套用,而不是針對個別漢字。
等與開合
另外兩個極為重要的因素,是等(等第)與開合(開口/合口)。
等(Division,等)
等反映母音與介音的位置特徵。
同一個韻,在不同等次下,可能發展出不同的漢越音。
例如:
介音是否出現,以及母音如何演變,都可能受到等的影響。
開口與合口
中古音節可分為:
- 開口
- 合口
它直接影響:
- 是否出現 u 介音
- 母音變化
- 某些情況下的聲母演變
忽略開合,往往會導致整個漢越音推導錯誤。
入聲與韻尾
漢越音的一大特色,是保留了中古漢語的大量入聲韻尾。
例如:
| Middle Chinese(中古漢語) | 漢越音 | |----------------------------|---------| | -p | -p | | -t | -t | | -k | -c/-ch |
因此,漢越音保留了許多普通話已經失去的歷史特徵。
例如:
| 漢字 | 普通話 | 漢越音 | |------|--------|---------| | 國 | guó | quốc | | 法 | fǎ | pháp | | 德 | dé | đức | | 學 | xué | học |
在 Quizzman Fanqie Engine 中,入聲不只決定聲調,同時也決定整個韻尾結構。
聲調並不只有六聲
很多人認為,引擎只需決定:
- 陰平
- 陽平
- 問聲
- 跌聲
- 去聲
- 重聲
事實上,Quizzman Fanqie Engine 內部首先建立的是 Eight Tone Slot(八聲位模型)。
包括:
- 陰平
- 陽平
- 陰上
- 陽上
- 陰去
- 陽去
- 陰入
- 陽入
之後才映射到現代越南語的六個聲調。
如此可保留完整的歷史音韻資訊。
規律優先,例外其次
Quizzman Fanqie Engine 的核心原則是:
不要用例外建立規律。
整個流程依序進行:
Middle Chinese
│
▼
音韻規律
│
▼
Pure Projection(純規律推導)
│
▼
詞彙比對
│
▼
歷史例外
因此,引擎即使遇到字典中不存在的漢字,也能依照規律完成推導。
若反過來先依賴例外,整個系統最終只會變成難以維護的大型對照表。
Pure Projection(純規律推導)
完成全部音韻規則後,引擎首先產生第一個推導結果。
這就是 Pure Projection(純規律推導)。
其特點包括:
- 完全不依賴字典
- 不依賴《Thiều Chửu(Thiều Chửu 漢越字典)》
- 不考慮讀音普及程度
- 只反映音韻規律本身
Pure Projection 描述的是:
如果只考慮歷史音變規律,這個漢字理論上應該發展成什麼漢越音?
它也是區分規律與歷史例外的重要基礎。
從規律走向詞彙層
自然語言從來不是完全理想化的。
一千多年來,許多漢字經歷了:
- 語義變化
- 讀音變化
- 多層借詞
- 地區差異
- 詞彙化(Lexicalization,詞彙化)
因此,在 Pure Projection 完成之後,Quizzman Fanqie Engine 才進入 Lexical Normalization(詞彙正規化)。
在這個階段,引擎會比對經過驗證的漢越文獻,評估多個候選結果,再選出最適合的讀音。
重要的是:
Lexical Normalization 不會修改音韻規律,只決定規律在歷史詞彙中的實際呈現方式。
模擬歷史,而不是記憶資料
Quizzman Fanqie Engine 最大的特色,不是能處理多少漢字。
真正不同的是,它如何理解整個問題。
對一般查詢系統而言,每個漢字都是一筆獨立資料。
對 Quizzman Fanqie Engine 而言,每個漢字只是同一套歷史音韻規律的一個具體實例。
與其記住數萬筆結果,引擎更重視重現產生這些結果的歷史過程。
因此,它不僅能應用於漢越音推導,也能延伸到歷史音韻研究、自然語言處理(Natural Language Processing,自然語言處理)以及其他以歷史語言學為基礎的計算應用。
下一篇
下一篇將介紹整個系統中最複雜的部分之一:
漢越聲調演算法。
內容將說明如何從中古漢語四聲建立 Eight Tone Slot(八聲位模型),以及清濁聲母如何影響聲調分化,最終形成現代越南語六聲系統。