汉越音推导演算法:从声母、韵母到现代汉越音系统

系列:Quizzman Fanqie Engine(反切引擎)第 5 篇。上一篇:〈中古汉语重建:Quizzman Fanqie Engine 的核心〉

汉越音推导演算法:从声母、韵母到现代汉越音系统

Quizzman Fanqie Engine(反切引擎)的特色,不在于查询某个汉越音,而在于推导汉越音。完成 Middle Chinese(中古汉语) 音系重建后,Engine(引擎)便开始模拟一千多年来的历史音变,逐步形成今日的汉越音。这是整个 Pipeline(处理流程)中最复杂的一个阶段,也是历史语言学、音韵学与演算法交会的核心。


从 Middle Chinese 到汉越音

完成 Middle Chinese(中古汉语)的重建后,Engine 已经掌握一个中古音节的完整音系资讯。

例如:

| 项目 | 值 | |------|----| | 声母 | 见母 | | 韵 | 庚韵 | | 摄 | 梗摄 | | 等 | 二等 | | 开合 | 开口 | | 声调 | 平声 |

这仍然不是汉越音。

它只是中古汉语音节的「音系蓝图」。

接下来,Quizzman Fanqie Engine 要回答的是:

如果八、九世纪的越南人接受了这个中古音节,它最终会发展成什么样的汉越音?

这就是 Sino-Vietnamese Projection(汉越音投射)


并不存在一张简单的对照表

许多人以为,中古汉语转成汉越音,只需要一张对照表即可。

例如:

见
↓

k

东
↓

ông

实际上,只有极少数情况可以如此简化。

一个汉越音并非由单一因素决定,而是许多音韵规律共同作用的结果。

例如,声母除了受到本身影响之外,还受到:

  • 开口或合口
  • 韵部特性
  • 历史音变
  • 借词层次

等因素共同影响。

韵母、韵尾以及声调亦是如此。

因此,Quizzman Fanqie Engine 并不使用固定对照表,而是依照历史音变顺序,逐步套用各项音韵规则。


第一阶段:决定声母

声母是最先处理的部分。

在中国音韵学中,声母代表音节开头的子音。

例如:

| 声母 | 常见对应 | |------|----------| | 帮 | b | | 滂 | ph | | 并 | b | | 明 | m | | 端 | đ | | 定 | đ | | 泥 | n | | 来 | l | | 见 | c、k | | 溪 | kh | | 群 | qu、c | | 晓 | h |

这些只是整体趋势。

例如,同样都是 见母,最后仍可能演变成:

  • c
  • k
  • gi

不同结果取决于后续的音韵环境。

因此,声母不能独立判定。


韵母决定音节主体

若声母决定子音,韵母便决定整个音节的大部分结构。

一个韵母通常包含:

  • 主要母音
  • 介音
  • 韵尾

许多情况下,更会影响整个音节的发展方向。

例如:

| 中古韵 | 汉越音 | |--------|---------| | 东韵 | ông | | 青韵 | anh | | 鱼韵 | ư |

这些并不是彼此独立的规则。

每一个韵都属于某一个,真正决定长期演变方向的是摄,而不是单一韵。


摄的重要性

中古音韵学把各韵分成不同的

例如:

  • 通摄
  • 江摄
  • 止摄
  • 遇摄
  • 蟹摄
  • 臻摄
  • 山摄
  • 效摄
  • 果摄
  • 假摄
  • 宕摄
  • 梗摄
  • 曾摄
  • 流摄
  • 深摄
  • 咸摄

对 Quizzman Fanqie Engine 而言,摄是推导汉越韵的重要讯号。

例如:

  • 通摄的入声通常保留 -c 韵尾。
  • 流摄常演变为 -âu-ưu-u
  • 梗摄与曾摄常依条件演变为 -anh-inh-eng

这些规则是在整个音系层级套用,而不是针对个别汉字。


等与开合

另外两个极为重要的因素,是等(等第)开合(开口/合口)

等(Division,等)

等反映母音与介音的位置特征。

同一个韵,在不同等次下,可能发展出不同的汉越音。

例如:

介音是否出现,以及母音如何演变,都可能受到等的影响。


开口与合口

中古音节可分为:

  • 开口
  • 合口

它直接影响:

  • 是否出现 u 介音
  • 母音变化
  • 某些情况下的声母演变

忽略开合,往往会导致整个汉越音推导错误。


入声与韵尾

汉越音的一大特色,是保留了中古汉语的大量入声韵尾。

例如:

| Middle Chinese(中古汉语) | 汉越音 | |----------------------------|---------| | -p | -p | | -t | -t | | -k | -c/-ch |

因此,汉越音保留了许多普通话已经失去的历史特征。

例如:

| 汉字 | 普通话 | 汉越音 | |------|--------|---------| | 国 | guó | quốc | | 法 | fǎ | pháp | | 德 | dé | đức | | 学 | xué | học |

在 Quizzman Fanqie Engine 中,入声不只决定声调,同时也决定整个韵尾结构。


声调并不只有六声

很多人认为,引擎只需决定:

  • 阴平
  • 阳平
  • 问声
  • 跌声
  • 去声
  • 重声

事实上,Quizzman Fanqie Engine 内部首先建立的是 Eight Tone Slot(八声位模型)

包括:

  • 阴平
  • 阳平
  • 阴上
  • 阳上
  • 阴去
  • 阳去
  • 阴入
  • 阳入

之后才映射到现代越南语的六个声调。

如此可保留完整的历史音韵资讯。


规律优先,例外其次

Quizzman Fanqie Engine 的核心原则是:

不要用例外建立规律。

整个流程依序进行:

Middle Chinese
        │
        ▼
音韵规律
        │
        ▼
Pure Projection(纯规律推导)
        │
        ▼
词汇比对
        │
        ▼
历史例外

因此,引擎即使遇到字典中不存在的汉字,也能依照规律完成推导。

若反过来先依赖例外,整个系统最终只会变成难以维护的大型对照表。


Pure Projection(纯规律推导)

完成全部音韵规则后,引擎首先产生第一个推导结果。

这就是 Pure Projection(纯规律推导)

其特点包括:

  • 完全不依赖字典
  • 不依赖《Thiều Chửu(Thiều Chửu 汉越字典)》
  • 不考虑读音普及程度
  • 只反映音韵规律本身

Pure Projection 描述的是:

如果只考虑历史音变规律,这个汉字理论上应该发展成什么汉越音?

它也是区分规律与历史例外的重要基础。


从规律走向词汇层

自然语言从来不是完全理想化的。

一千多年来,许多汉字经历了:

  • 语义变化
  • 读音变化
  • 多层借词
  • 地区差异
  • 词汇化(Lexicalization,词汇化)

因此,在 Pure Projection 完成之后,Quizzman Fanqie Engine 才进入 Lexical Normalization(词汇正规化)

在这个阶段,引擎会比对经过验证的汉越文献,评估多个候选结果,再选出最适合的读音。

重要的是:

Lexical Normalization 不会修改音韵规律,只决定规律在历史词汇中的实际呈现方式。


模拟历史,而不是记忆资料

Quizzman Fanqie Engine 最大的特色,不是能处理多少汉字。

真正不同的是,它如何理解整个问题。

对一般查询系统而言,每个汉字都是一笔独立资料。

对 Quizzman Fanqie Engine 而言,每个汉字只是同一套历史音韵规律的一个具体实例。

与其记住数万笔结果,引擎更重视重现产生这些结果的历史过程。

因此,它不仅能应用于汉越音推导,也能延伸到历史音韵研究、自然语言处理(Natural Language Processing,自然语言处理)以及其他以历史语言学为基础的计算应用。


下一篇

下一篇将介绍整个系统中最复杂的部分之一:

汉越声调演算法

内容将说明如何从中古汉语四声建立 Eight Tone Slot(八声位模型),以及清浊声母如何影响声调分化,最终形成现代越南语六声系统。