Quizzman Fanqie Engine 系列 — 第 8 篇。上一篇:汉越韵母系统:十六摄
从音韵规律到实际语言:为什么 Quizzman Fanqie Engine 仍然需要 Lexical Normalization?
如果所有汉越音都完全遵循音韵规律,那么建立一套汉越音 Engine 将会非常简单。只要准确重建 Middle Chinese,再套用历史音变规则即可。然而,自然语言从来不是如此理想。超过一千年的历史,留下了不同时期的借词、语义演变、多音字、异读以及各种历史例外。因此,在完成整个音韵推导流程之后,Quizzman Fanqie Engine 还需要执行另一个重要步骤:Lexical Normalization。它负责连接音韵规律与现代汉越词汇的历史发展。
为什么只有规律还不够?
在前面的文章中,我们已经看到 Engine 能够根据:
- 声母
- 韵母
- 摄
- 等
- 开口与合口
- 平、上、去、入四声
- 各种历史音变规律
推导出一个汉越音。
如果所有汉字都完全符合这些规律,那么整个流程就是:
反切
↓
Middle Chinese
↓
音韵规律
↓
汉越音
然而,真正的历史并非如此。
在超过一千年的汉字使用过程中,
越南语不断吸收、调整并重新标准化汉越读音。
有些规律被完整保留下来。
也有不少规律在语言演变过程中被打破。
因此,
Pure Projection 并不能直接作为最终答案。
汉越音是一套仍然演化中的系统
一个常见的误解是:
把汉越音视为唐代汉语的一张「快照」。
这只说对了一部分。
汉越音确实保存了大量 Middle Chinese 的特征。
但在进入越南语之后,
它仍然持续发展。
数百年间,
陆续出现了:
- 新读法
- 古读残留
- 地方读音
- 不同借词层
- 与越南语本身的同化现象
因此:
今天的汉越读音,并不一定完全反映最初的音韵规律。
一个最简单的例子
假设 Engine 只依照音韵规律运作。
它可能得到:
Middle Chinese
↓
Pure Projection
↓
A
然而,
历史上的越南语却真正采用了:
B
并且今天的词典也是如此记录。
这时存在两种可能:
第一种:
Engine 推导错误。
第二种:
Engine 推导正确,
只是语言后来沿着另一条历史路径发展。
这两种情况完全不同。
若无法区分,
修改 Engine 将十分危险。
Pure Projection 不是最终结果
在 Quizzman Fanqie Engine 中,
第一个推导结果称为:
Pure Projection
它完全依照音韵规律产生。
不依赖:
- 词典
- 汉越资料库
- 常用读音
- 使用频率统计
Pure Projection 只回答一个问题:
如果只考虑历史音韵规律,这个汉字应该发展成什么样的汉越音?
它是整套系统的重要基准。
当历史不再遵循规律
Pure Projection 完成后,
Engine 才开始与历史资料比对。
例如:
Pure Projection
↓
quốc
若词典同样记载:
quốc
那么没有任何问题。
但也可能出现:
Pure Projection
↓
A
而标准汉越词汇却记录:
B
这时,
Engine 不会立刻修改结果。
首先要判断:
- 是规律错了?
- 还是历史走向不同?
这正是 Lexical Normalization 的工作。
与词典不同,不代表规律错误
Quizzman Fanqie Engine 有一项重要原则:
不同于词典,不等于音韵规律错误。
例如,
同一个汉字可能同时存在:
- 文读
- 口语读音
- 古读
- 新读
- 多个借词层
如果 Engine 强制所有结果都符合现代词典,
那么音韵研究的价值就会消失。
因此,
Engine 始终区分:
规律错误
≠
词汇层差异
这是整个架构最重要的设计理念之一。
Lexical Normalization 做什么?
完成 Pure Projection 后,
Engine 会开始与历史资料比对。
流程如下:
Pure Projection
↓
资料比对
↓
评估
↓
Hybrid Result
所使用的资料包括:
- 《Thiều Chửu》
- 标准汉越词汇资料
- 人工校订资料
- 已验证的历史读音
需要强调的是:
这些资料并不修改音韵规律。
它们只是协助 Engine,
在今日的词汇层中,
选择最适合的表现形式。
Candidate Ranking
有些汉字并不只有一组反切。
不同韵书可能记录:
- 不同反切
- 不同韵部
- 不同历史读音
如果 Engine 直接采用第一笔资料,
准确率将明显下降。
因此,
Quizzman Fanqie Engine 建立了 Candidate Ranking。
每个候选读音都会根据多项因素评分,例如:
- 反切来源
- 是否符合音韵规律
- 与标准汉越词汇的吻合程度
- 属于古读或现代读
- 资料来源可信度
最后,
得分最高者成为最终结果。
Hybrid 并不是「修补错误」
有人认为:
Hybrid 就是 Engine 推错,再用词典修正。
这完全不是事实。
在 Quizzman Fanqie Engine 中:
Pure Projection
↓
历史音韵模型
Lexical Layer
↓
实际词汇模型
Hybrid 是这两层资讯的结合。
它并不是补救机制。
相反地,
它正是:
- 理想音韵系统
- 真实语言历史
两者之间的模型化结果。
为什么 Hybrid 更准确?
内部测试显示:
Pure Projection 对音韵规律的描述已经相当准确。
但直接与现代标准汉越词典相比,
仍然存在一些由历史语言演变造成的差异。
加入 Lexical Normalization 后,
Engine 与汉越词典的吻合率大幅提高,
同时底层音韵规律完全保持不变。
这也反映出汉越音真正的本质:
它不只是音韵规律的结果,
也是超过一千年语言使用与标准化的成果。
四种可信度指标
Quizzman Fanqie Engine 的另一个特色是:
每个结果都附带多种可信度评估。
Engine 不只回传一个读音,
也同时说明每一层处理的可信程度。
例如:
- Source Confidence:反切及资料来源的可信度
- Phonological Confidence:符合音韵规律的程度
- Lexical Confidence:与已验证汉越词汇的吻合程度
- Final Confidence:整体综合评估结果
因此,
使用者不仅知道 Engine 如何读,
更知道:
为什么 Engine 会做出这样的选择。
不只是一本词典,而是一套推理系统
Quizzman Fanqie Engine 最大的特色,
并不在于支援多少汉字。
真正的差异,
在于它的设计理念。
传统词典只保存最终答案。
Quizzman Fanqie Engine 则保存:
整个产生答案的推理过程。
因此,
系统能够区分:
- 音韵规律
- 词汇层
- 历史例外
- 文读变体
- 资料错误
正因如此,
Engine 不只是汉越音查询工具,
更是一套能够解释、验证每一个推导结果的历史音韵研究平台。
下一篇
至此,我们已经了解整个流程:
从反切、
到 Middle Chinese 重建、
再到汉越音推导,
以及最后的 Lexical Normalization。
下一篇文章将探讨 Quizzman Fanqie Engine 的准确率,
介绍系统如何利用数千个汉字进行 Benchmark、评估 Pure Projection 与 Hybrid 的表现,以及为什么音韵引擎的评估方式不能只依赖传统词典那种「对/错」的标准。