从音韵规律到实际语言:为什么 Quizzman Fanqie Engine 仍然需要 Lexical Normalization?

Quizzman Fanqie Engine 系列 — 第 8 篇。上一篇:汉越韵母系统:十六摄

从音韵规律到实际语言:为什么 Quizzman Fanqie Engine 仍然需要 Lexical Normalization?

如果所有汉越音都完全遵循音韵规律,那么建立一套汉越音 Engine 将会非常简单。只要准确重建 Middle Chinese,再套用历史音变规则即可。然而,自然语言从来不是如此理想。超过一千年的历史,留下了不同时期的借词、语义演变、多音字、异读以及各种历史例外。因此,在完成整个音韵推导流程之后,Quizzman Fanqie Engine 还需要执行另一个重要步骤:Lexical Normalization。它负责连接音韵规律与现代汉越词汇的历史发展。

为什么只有规律还不够?

在前面的文章中,我们已经看到 Engine 能够根据:

  • 声母
  • 韵母
  • 开口与合口
  • 平、上、去、入四声
  • 各种历史音变规律

推导出一个汉越音。

如果所有汉字都完全符合这些规律,那么整个流程就是:

反切
    ↓
Middle Chinese
    ↓
音韵规律
    ↓
汉越音

然而,真正的历史并非如此。

在超过一千年的汉字使用过程中,

越南语不断吸收、调整并重新标准化汉越读音。

有些规律被完整保留下来。

也有不少规律在语言演变过程中被打破。

因此,

Pure Projection 并不能直接作为最终答案。


汉越音是一套仍然演化中的系统

一个常见的误解是:

把汉越音视为唐代汉语的一张「快照」。

这只说对了一部分。

汉越音确实保存了大量 Middle Chinese 的特征。

但在进入越南语之后,

它仍然持续发展。

数百年间,

陆续出现了:

  • 新读法
  • 古读残留
  • 地方读音
  • 不同借词层
  • 与越南语本身的同化现象

因此:

今天的汉越读音,并不一定完全反映最初的音韵规律。


一个最简单的例子

假设 Engine 只依照音韵规律运作。

它可能得到:

Middle Chinese
        ↓
Pure Projection
        ↓
A

然而,

历史上的越南语却真正采用了:

B

并且今天的词典也是如此记录。

这时存在两种可能:

第一种:

Engine 推导错误。

第二种:

Engine 推导正确,

只是语言后来沿着另一条历史路径发展。

这两种情况完全不同。

若无法区分,

修改 Engine 将十分危险。


Pure Projection 不是最终结果

在 Quizzman Fanqie Engine 中,

第一个推导结果称为:

Pure Projection

它完全依照音韵规律产生。

不依赖:

  • 词典
  • 汉越资料库
  • 常用读音
  • 使用频率统计

Pure Projection 只回答一个问题:

如果只考虑历史音韵规律,这个汉字应该发展成什么样的汉越音?

它是整套系统的重要基准。


当历史不再遵循规律

Pure Projection 完成后,

Engine 才开始与历史资料比对。

例如:

Pure Projection
        ↓
      quốc

若词典同样记载:

quốc

那么没有任何问题。

但也可能出现:

Pure Projection
        ↓
A

而标准汉越词汇却记录:

B

这时,

Engine 不会立刻修改结果。

首先要判断:

  • 是规律错了?
  • 还是历史走向不同?

这正是 Lexical Normalization 的工作。


与词典不同,不代表规律错误

Quizzman Fanqie Engine 有一项重要原则:

不同于词典,不等于音韵规律错误。

例如,

同一个汉字可能同时存在:

  • 文读
  • 口语读音
  • 古读
  • 新读
  • 多个借词层

如果 Engine 强制所有结果都符合现代词典,

那么音韵研究的价值就会消失。

因此,

Engine 始终区分:

规律错误
      ≠
词汇层差异

这是整个架构最重要的设计理念之一。


Lexical Normalization 做什么?

完成 Pure Projection 后,

Engine 会开始与历史资料比对。

流程如下:

Pure Projection
        ↓
资料比对
        ↓
评估
        ↓
Hybrid Result

所使用的资料包括:

  • 《Thiều Chửu》
  • 标准汉越词汇资料
  • 人工校订资料
  • 已验证的历史读音

需要强调的是:

这些资料并不修改音韵规律。

它们只是协助 Engine,

在今日的词汇层中,

选择最适合的表现形式。


Candidate Ranking

有些汉字并不只有一组反切。

不同韵书可能记录:

  • 不同反切
  • 不同韵部
  • 不同历史读音

如果 Engine 直接采用第一笔资料,

准确率将明显下降。

因此,

Quizzman Fanqie Engine 建立了 Candidate Ranking

每个候选读音都会根据多项因素评分,例如:

  • 反切来源
  • 是否符合音韵规律
  • 与标准汉越词汇的吻合程度
  • 属于古读或现代读
  • 资料来源可信度

最后,

得分最高者成为最终结果。


Hybrid 并不是「修补错误」

有人认为:

Hybrid 就是 Engine 推错,再用词典修正。

这完全不是事实。

在 Quizzman Fanqie Engine 中:

Pure Projection
        ↓
历史音韵模型
Lexical Layer
        ↓
实际词汇模型

Hybrid 是这两层资讯的结合。

它并不是补救机制。

相反地,

它正是:

  • 理想音韵系统
  • 真实语言历史

两者之间的模型化结果。


为什么 Hybrid 更准确?

内部测试显示:

Pure Projection 对音韵规律的描述已经相当准确。

但直接与现代标准汉越词典相比,

仍然存在一些由历史语言演变造成的差异。

加入 Lexical Normalization 后,

Engine 与汉越词典的吻合率大幅提高,

同时底层音韵规律完全保持不变。

这也反映出汉越音真正的本质:

它不只是音韵规律的结果,

也是超过一千年语言使用与标准化的成果。


四种可信度指标

Quizzman Fanqie Engine 的另一个特色是:

每个结果都附带多种可信度评估。

Engine 不只回传一个读音,

也同时说明每一层处理的可信程度。

例如:

  • Source Confidence:反切及资料来源的可信度
  • Phonological Confidence:符合音韵规律的程度
  • Lexical Confidence:与已验证汉越词汇的吻合程度
  • Final Confidence:整体综合评估结果

因此,

使用者不仅知道 Engine 如何读,

更知道:

为什么 Engine 会做出这样的选择。


不只是一本词典,而是一套推理系统

Quizzman Fanqie Engine 最大的特色,

并不在于支援多少汉字。

真正的差异,

在于它的设计理念。

传统词典只保存最终答案。

Quizzman Fanqie Engine 则保存:

整个产生答案的推理过程。

因此,

系统能够区分:

  • 音韵规律
  • 词汇层
  • 历史例外
  • 文读变体
  • 资料错误

正因如此,

Engine 不只是汉越音查询工具,

更是一套能够解释、验证每一个推导结果的历史音韵研究平台。


下一篇

至此,我们已经了解整个流程:

从反切、

到 Middle Chinese 重建、

再到汉越音推导,

以及最后的 Lexical Normalization。

下一篇文章将探讨 Quizzman Fanqie Engine 的准确率

介绍系统如何利用数千个汉字进行 Benchmark、评估 Pure Projection 与 Hybrid 的表现,以及为什么音韵引擎的评估方式不能只依赖传统词典那种「对/错」的标准。