Quizzman Fanqie Engine 系列(第七篇)
上一篇:声调演算法:Eight Tone Slot
汉越音韵母系统:从中古汉语十六摄到数百个越南语韵母
如果说声母决定了一个音节如何开始,那么韵母便决定了它如何结束。事实上,汉越音超过七成以上的差异都来自韵母。元音、介音与韵尾共同形成了 -ang、-anh、-iêm、-ương、-uân、-uốc、-iệt、-oát 等熟悉的越南语韵母。而在这些表面形式背后,则是中古汉语由十六摄、众多韵部及多层音变规律构成的庞大音韵系统。Quizzman Fanqie Engine 并不是逐一记录每个韵母,而是透过演算法完整建模其历史演变过程。
为什么韵母比声母更复杂?
上一篇文章提到,
声母主要决定音节的起始子音。
例如:
帮
↓
b
或:
明
↓
m
虽然也存在一些例外,
但中古汉语的声母数量相对有限。
韵母则复杂得多。
一个韵母,
并不只是元音而已。
它同时包含:
- 介音。
- 主要元音。
- 韵尾元音。
- 韵尾子音。
- 与声调的关系。
- 与开口、合口的关系。
- 与等的关系。
- 与整个摄系统的关系。
换句话说,
汉越音大部分的音节面貌,
都是由韵母所决定。
什么是韵母?
在中国传统音韵学中,
一个音节可分为两大部分:
声母
+
韵母
声母,
是音节开头的子音。
韵母,
则包含声母以外的所有部分。
例如:
东
↓
đ
+
ông
其中:
đ
↓
声母
ông
↓
韵母
又例如:
国
↓
qu
+
ốc
以及:
学
↓
h
+
ọc
许多学习汉越音的人,
往往较注意声母。
然而,
真正决定音节特色的,
其实是韵母。
韵部并非彼此孤立
翻阅《广韵》时,
可以看到数百个不同的韵部。
乍看之下,
这似乎十分难以掌握。
然而,
早期音韵学家便已发现:
许多韵部在历史演变上的行为非常相似。
因此,
便将它们归纳成较大的分类:
摄(摄)。
可以简单理解为:
韵
↓
摄
或者说:
摄,就是一群具有相似演变规律的韵部家族。
属于同一摄的韵,
在发展成汉越音时,
通常具有相近的变化方向。
因此,
Quizzman Fanqie Engine 会先判断「摄」,
而不是直接针对每一个韵部建立规则。
中古汉语十六摄
《广韵》的韵系,
一般可归纳为十六摄。
| 摄 | 代表韵 | |------|---------| | 通摄 | 东、冬、钟 | | 江摄 | 江 | | 止摄 | 支、脂、之、微 | | 遇摄 | 鱼、虞、模 | | 蟹摄 | 齐、佳、皆、灰、咍、祭…… | | 臻摄 | 真、谆、文、欣、魂…… | | 山摄 | 元、寒、桓、删、山…… | | 效摄 | 萧、宵、肴、豪 | | 果摄 | 歌、戈 | | 假摄 | 麻 | | 宕摄 | 唐、阳 | | 梗摄 | 庚、耕、清、青 | | 曾摄 | 蒸、登 | | 流摄 | 尤、侯、幽 | | 深摄 | 侵 | | 咸摄 | 覃、谈、盐、添、咸、衔…… |
这是整个中国传统音韵学最重要的分类之一。
若不知道一个韵属于哪一摄,
几乎无法建立系统性的汉越音推导演算法。
为什么要依照摄来处理?
假设必须为每一个韵部个别撰写规则,
规则数量将高达数百条。
若改以摄为单位,
大量规律便可共用。
例如:
通摄
↓
多数入声保留 -c 韵尾
而:
流摄
↓
常发展为
-âu
-ưu
-u
又例如:
梗摄
↓
-anh
-inh
-ênh
依不同条件而变化。
因此,
Engine 不需撰写数百条零散规则,
而是建立每一摄的整体模型。
这也是整个系统兼具准确性与可扩充性的原因。
「等」如何影响韵母?
除了摄之外,
每个韵还属于四等之一:
- 一等
- 二等
- 三等
- 四等
「等」反映的是元音结构上的细微差异。
许多情况下,
即使:
- 声母相同。
- 同属一摄。
只因等不同,
最后便形成不同的汉越音韵母。
例如:
相同声母
+
相同摄
↓
不同等
↓
不同元音
若忽略等,
推导错误率将快速增加。
因此,
Quizzman Fanqie Engine 将「等」完整保存于 Middle Chinese Profile 中。
开口与合口
另一项经常被忽略的重要因素,
便是:
- 开口(开口)
- 合口(合口)
可以简单理解为:
- 开口:没有唇化介音。
- 合口:具有唇化成分。
这会直接影响不少汉越音韵母。
例如:
a
↓
oa
以及:
ang
↓
oang
在特定语音环境下,
若忽略开口、合口,
Engine 便无法合理解释,
为何部分汉越音会出现 u 或 o 的介音。
入声与韵尾子音
汉越音最珍贵的特点之一,
就是保留了中古汉语大量入声韵尾。
例如:
| 中古汉语 | 汉越音 | |-----------|---------| | -p | -p | | -t | -t | | -k | -c/-ch |
这些韵尾,
在现代普通话中几乎已完全消失。
例如:
| 汉字 | 普通话 | 汉越音 | |------|---------|---------| | 法 | fǎ | pháp | | 德 | dé | đức | | 国 | guó | quốc | | 学 | xué | học |
对 Quizzman Fanqie Engine 而言,
正确判断韵尾的重要性,
丝毫不亚于声调。
为什么有时是 -c,有时却变成 -ch?
这是最常见的问题之一。
例如:
国
↓
quốc
但:
白
↓
bạch
两者原本都来自中古汉语 -k 韵尾,
为何最后不同?
答案就在于:
腭化(Palatalization)。
在部分元音环境中,
韵尾 -k 会逐渐向口腔前方移动,
最后演变成:
-k
↓
-ch
而其他环境则维持:
-k
↓
-c
这并不是例外,
而是一条音韵规律。
Quizzman Fanqie Engine 会依据:
- 摄。
- 核心元音。
- 腭化条件。
共同判断结果,
而非逐字记忆。
Rule Engine,而非对照表
仔细观察整个韵母推导流程,
可以发现,
Engine 并不是询问:
「这个字怎么读?」
而是依序回答:
- 属于哪个韵?
- 属于哪一摄?
- 第几等?
- 开口还是合口?
- 入声还是舒声?
- 是否发生腭化?
完成所有判断后,
才生成对应的汉越音韵母。
因此,
同一套规律,
即可重复应用于数千个汉字。
建模,而不是记忆
这正是 Quizzman Fanqie Engine 一贯的设计理念。
一般字典储存的是:
国
↓
quốc
德
↓
đức
学
↓
học
三笔彼此独立的资料。
Quizzman Fanqie Engine 则储存:
通摄
↓
规律 A
江摄
↓
规律 B
梗摄
↓
规律 C
再由演算法自动推导:
- quốc
- đức
- học
- cốc
- mục
- cực
- bạch
- mạch
以及数千个其他汉越音。
这正是资料库与推论系统最大的差异。
下一篇
了解韵母推导之后,
汉越音形成流程已大致完整。
然而,
实际语言仍存在许多仅靠音韵规律无法决定的情况,
例如:
- 多音字。
- 多种反切。
- 多个历史读音层。
- 历史例外。
下一篇将介绍 Quizzman Fanqie Engine 的 Lexical Normalization,
说明系统如何将音韵规律与历史词汇资料结合,
产生最终可信度更高的汉越音结果。