系列:Quizzman Fanqie Engine(反切引擎)第 5 篇。上一篇:〈中古汉语重建:Quizzman Fanqie Engine 的核心〉。
汉越音推导演算法:从声母、韵母到现代汉越音系统
Quizzman Fanqie Engine(反切引擎)的特色,不在于查询某个汉越音,而在于推导汉越音。完成 Middle Chinese(中古汉语) 音系重建后,Engine(引擎)便开始模拟一千多年来的历史音变,逐步形成今日的汉越音。这是整个 Pipeline(处理流程)中最复杂的一个阶段,也是历史语言学、音韵学与演算法交会的核心。
从 Middle Chinese 到汉越音
完成 Middle Chinese(中古汉语)的重建后,Engine 已经掌握一个中古音节的完整音系资讯。
例如:
| 项目 | 值 | |------|----| | 声母 | 见母 | | 韵 | 庚韵 | | 摄 | 梗摄 | | 等 | 二等 | | 开合 | 开口 | | 声调 | 平声 |
这仍然不是汉越音。
它只是中古汉语音节的「音系蓝图」。
接下来,Quizzman Fanqie Engine 要回答的是:
如果八、九世纪的越南人接受了这个中古音节,它最终会发展成什么样的汉越音?
这就是 Sino-Vietnamese Projection(汉越音投射)。
并不存在一张简单的对照表
许多人以为,中古汉语转成汉越音,只需要一张对照表即可。
例如:
见
↓
k
或
东
↓
ông
实际上,只有极少数情况可以如此简化。
一个汉越音并非由单一因素决定,而是许多音韵规律共同作用的结果。
例如,声母除了受到本身影响之外,还受到:
- 等
- 开口或合口
- 韵部特性
- 历史音变
- 借词层次
等因素共同影响。
韵母、韵尾以及声调亦是如此。
因此,Quizzman Fanqie Engine 并不使用固定对照表,而是依照历史音变顺序,逐步套用各项音韵规则。
第一阶段:决定声母
声母是最先处理的部分。
在中国音韵学中,声母代表音节开头的子音。
例如:
| 声母 | 常见对应 | |------|----------| | 帮 | b | | 滂 | ph | | 并 | b | | 明 | m | | 端 | đ | | 定 | đ | | 泥 | n | | 来 | l | | 见 | c、k | | 溪 | kh | | 群 | qu、c | | 晓 | h |
这些只是整体趋势。
例如,同样都是 见母,最后仍可能演变成:
- c
- k
- gi
不同结果取决于后续的音韵环境。
因此,声母不能独立判定。
韵母决定音节主体
若声母决定子音,韵母便决定整个音节的大部分结构。
一个韵母通常包含:
- 主要母音
- 介音
- 韵尾
许多情况下,更会影响整个音节的发展方向。
例如:
| 中古韵 | 汉越音 | |--------|---------| | 东韵 | ông | | 青韵 | anh | | 鱼韵 | ư |
这些并不是彼此独立的规则。
每一个韵都属于某一个摄,真正决定长期演变方向的是摄,而不是单一韵。
摄的重要性
中古音韵学把各韵分成不同的摄。
例如:
- 通摄
- 江摄
- 止摄
- 遇摄
- 蟹摄
- 臻摄
- 山摄
- 效摄
- 果摄
- 假摄
- 宕摄
- 梗摄
- 曾摄
- 流摄
- 深摄
- 咸摄
对 Quizzman Fanqie Engine 而言,摄是推导汉越韵的重要讯号。
例如:
- 通摄的入声通常保留 -c 韵尾。
- 流摄常演变为 -âu、-ưu 或 -u。
- 梗摄与曾摄常依条件演变为 -anh、-inh 或 -eng。
这些规则是在整个音系层级套用,而不是针对个别汉字。
等与开合
另外两个极为重要的因素,是等(等第)与开合(开口/合口)。
等(Division,等)
等反映母音与介音的位置特征。
同一个韵,在不同等次下,可能发展出不同的汉越音。
例如:
介音是否出现,以及母音如何演变,都可能受到等的影响。
开口与合口
中古音节可分为:
- 开口
- 合口
它直接影响:
- 是否出现 u 介音
- 母音变化
- 某些情况下的声母演变
忽略开合,往往会导致整个汉越音推导错误。
入声与韵尾
汉越音的一大特色,是保留了中古汉语的大量入声韵尾。
例如:
| Middle Chinese(中古汉语) | 汉越音 | |----------------------------|---------| | -p | -p | | -t | -t | | -k | -c/-ch |
因此,汉越音保留了许多普通话已经失去的历史特征。
例如:
| 汉字 | 普通话 | 汉越音 | |------|--------|---------| | 国 | guó | quốc | | 法 | fǎ | pháp | | 德 | dé | đức | | 学 | xué | học |
在 Quizzman Fanqie Engine 中,入声不只决定声调,同时也决定整个韵尾结构。
声调并不只有六声
很多人认为,引擎只需决定:
- 阴平
- 阳平
- 问声
- 跌声
- 去声
- 重声
事实上,Quizzman Fanqie Engine 内部首先建立的是 Eight Tone Slot(八声位模型)。
包括:
- 阴平
- 阳平
- 阴上
- 阳上
- 阴去
- 阳去
- 阴入
- 阳入
之后才映射到现代越南语的六个声调。
如此可保留完整的历史音韵资讯。
规律优先,例外其次
Quizzman Fanqie Engine 的核心原则是:
不要用例外建立规律。
整个流程依序进行:
Middle Chinese
│
▼
音韵规律
│
▼
Pure Projection(纯规律推导)
│
▼
词汇比对
│
▼
历史例外
因此,引擎即使遇到字典中不存在的汉字,也能依照规律完成推导。
若反过来先依赖例外,整个系统最终只会变成难以维护的大型对照表。
Pure Projection(纯规律推导)
完成全部音韵规则后,引擎首先产生第一个推导结果。
这就是 Pure Projection(纯规律推导)。
其特点包括:
- 完全不依赖字典
- 不依赖《Thiều Chửu(Thiều Chửu 汉越字典)》
- 不考虑读音普及程度
- 只反映音韵规律本身
Pure Projection 描述的是:
如果只考虑历史音变规律,这个汉字理论上应该发展成什么汉越音?
它也是区分规律与历史例外的重要基础。
从规律走向词汇层
自然语言从来不是完全理想化的。
一千多年来,许多汉字经历了:
- 语义变化
- 读音变化
- 多层借词
- 地区差异
- 词汇化(Lexicalization,词汇化)
因此,在 Pure Projection 完成之后,Quizzman Fanqie Engine 才进入 Lexical Normalization(词汇正规化)。
在这个阶段,引擎会比对经过验证的汉越文献,评估多个候选结果,再选出最适合的读音。
重要的是:
Lexical Normalization 不会修改音韵规律,只决定规律在历史词汇中的实际呈现方式。
模拟历史,而不是记忆资料
Quizzman Fanqie Engine 最大的特色,不是能处理多少汉字。
真正不同的是,它如何理解整个问题。
对一般查询系统而言,每个汉字都是一笔独立资料。
对 Quizzman Fanqie Engine 而言,每个汉字只是同一套历史音韵规律的一个具体实例。
与其记住数万笔结果,引擎更重视重现产生这些结果的历史过程。
因此,它不仅能应用于汉越音推导,也能延伸到历史音韵研究、自然语言处理(Natural Language Processing,自然语言处理)以及其他以历史语言学为基础的计算应用。
下一篇
下一篇将介绍整个系统中最复杂的部分之一:
汉越声调演算法。
内容将说明如何从中古汉语四声建立 Eight Tone Slot(八声位模型),以及清浊声母如何影响声调分化,最终形成现代越南语六声系统。