Quizzman Fanqie Engine 的准确率:如何评估一套历史音韵引擎?

Quizzman Fanqie Engine 系列(第九篇)

上一篇:Lexical Normalization

Quizzman Fanqie Engine 的准确率:如何评估一套历史音韵引擎?

许多人第一次接触 Quizzman Fanqie Engine 时,最常提出的问题就是:这套 Engine 的准确率是多少? 这是一个合理的问题,但并不容易回答。与 OCR、机器翻译或影像辨识不同,历史音韵引擎并非只产生唯一答案。它必须同时重建历史音韵规律、处理不同读音层次,并区分音韵规律与词汇例外。因此,评估 Fanqie Engine 并不是单纯计算「答对几个字」,而是需要一套多层次的测试与评估方法。

为什么不能只说「准确率 95%」?

评估电子字典时,

通常非常直接。

例如:

国
 │
 ▼
quốc

如果系统输出 quốc

即可判定正确。

若输出 quấc

则视为错误。

然而,

对历史音韵引擎而言,

问题并没有这么单纯。

同一个汉字,

可能同时存在:

  • 多种反切。
  • 多种历史读音。
  • 多个汉越音层次。
  • 不同文献来源。

因此,

即使 Engine 的结果与现代字典不同,

也未必代表它错了。

有可能:

  • 音韵推导完全正确。
  • 只是现代词汇层已经改变。

因此,

Quizzman Fanqie Engine 并不以单一百分比作为评价标准。

两个完全不同的目标

Quizzman Fanqie Engine 同时追求两项彼此独立的目标。

第一个目标

音韵规律是否正确?

这就是 Pure Projection

在这一层,

Engine 仅依据:

  • 反切。
  • 中古汉语。
  • 音韵规律。

完全不使用任何字典资料

第二个目标

最终读音是否符合今日通行的汉越音?

这就是 Hybrid

除了音韵规律,

Engine 还会参考:

  • 汉越音资料。
  • 历史读音层。
  • Thiều Chửu 字典。
  • Candidate Ranking。

两者评估的是不同问题。

一个结果,

可能在音韵推导上完全正确,

却因词汇演变而与今日常见读音不同。

Pure Projection 评估什么?

Pure Projection 只回答一个问题:

如果完全依照汉越音的历史音韵规律推导,结果应该是什么?

因此,

它不考虑:

  • 现代越南人如何发音。
  • 字典如何记载。
  • 哪一种读法最普遍。

唯一评估的是:

音韵推导是否正确。

这也是整个系统最困难的部分,

因为所有责任都来自演算法本身。

Hybrid 评估什么?

Hybrid 解决的是另一个问题。

当 Pure Projection 得出音韵结果后,

Engine 会进一步与历史汉越音资料进行比对。

若同时存在多个候选读音,

系统便综合评估:

  • 反切来源。
  • 是否符合音韵规律。
  • 历史读音层。
  • 字典资料。
  • 各候选结果的可信度。

最后产生最适合的读音。

这也是 Quizzman Fanqie Engine 提供给一般使用者的预设模式。

Benchmark 如何建立?

为了客观评估 Engine,

Quizzman Fanqie Engine 并非依赖单一测试集,

而是建立多组不同用途的 Benchmark。

包括:

  • Golden Fixture
  • Random Corpus
  • Thiều Chửu Benchmark
  • Batch Regression
  • Audit Corpus
  • Stress Test

每一组资料,

都用来回答不同的问题。

Golden Fixture

Golden Fixture 是整个测试系统中最重要的一组资料。

其中所有汉字,

皆经过人工逐一验证。

涵盖内容包括:

  • 平声。
  • 上声。
  • 去声。
  • 入声。
  • 清声母。
  • 浊声母。
  • 各种历史特殊案例。

Golden Fixture 的目的,

并不是提高 Benchmark 分数。

它最大的用途是:

侦测 Regression(回归错误)。

只要某次修改破坏了原本正确的音韵规律,

Golden Fixture 就能立即发现。

Random Corpus

Golden Fixture 通常规模较小。

因此,

还需要更大的测试资料。

Random Corpus 是由汉越音资料库随机抽样建立。

例如:

  • Random 300
  • Random 300B

主要用来评估整个 Pipeline 在接近真实情境下的表现。

目前内部测试中,

Hybrid 在此资料集上的一致率约为:

89%

值得注意的是,

Pure Projection 的一致率则低于 Hybrid。

这并不是音韵演算法较差,

反而说明今日汉越音已经历了大量词汇化(Lexicalization)的演变。

Thiều Chửu Benchmark

另一项重要测试,

是与 Thiều Chửu 汉越字典进行比对。

Thiều Chửu 是越南影响最深远的汉越字典之一。

在约一千个汉字的内部测试中,

Hybrid 与主要读音的符合率约为:

94.5%

这代表:

Lexical Normalization 能有效选择符合现代汉越音使用习惯的读法。

不过,

此 Benchmark 并不是要证明 Thiều Chửu 就是唯一标准,

而是评估 Engine 与主流资料来源之间的相容程度。

数千汉字的 Audit

除了小型 Benchmark,

Quizzman Fanqie Engine 也会在数千个汉字上进行 Audit。

不同於单纯的「正确/错误」,

系统会将每一笔结果分类,例如:

  • 完全正确。
  • 词汇层差异。
  • 多音字。
  • 拼写差异。
  • 历史例外。
  • 真正的音韵规律错误。

如此一来,

开发者便能明确知道问题究竟出在哪一层。

若所有案例都只标记为「错误」,

将很难有系统地改善 Engine。

最重要的指标:True Rule Error

在 Quizzman Fanqie Engine 的开发过程中,

团队并不把所有差异都视为错误。

真正关注的是:

True Rule Error

也就是:

  • 音韵规律套用错误。
  • 中古汉语重建错误。
  • Projection 推导错误。
  • 无法用历史音韵解释的结果。

这些,

才是真正需要修正的问题。

至于:

  • 不同读音层。
  • 多音字。
  • 文读。
  • 白读。

通常会交由 Lexical Normalization 处理,

而不是修改音韵演算法。

Regression Test

开发历史音韵 Engine 最大的风险之一,

就是:

修正一条规律,

却意外破坏数百条原本正确的规律。

因此,

每次重大更新后,

所有 Benchmark 都会重新执行。

若发现:

  • Hybrid 准确率下降。
  • True Rule Error 增加。
  • Golden Fixture 出现新的错误。

该次修改便会重新检讨。

透过这样的流程,

Quizzman Fanqie Engine 能持续新增功能,

同时维持整体规律的稳定性。

准确率不只是单一数字

可以看出,

评估 Quizzman Fanqie Engine,

与评估一般查询工具有很大的不同。

与其问:

「Engine 的准确率是多少?」

更重要的是回答:

  • 音韵规律是否正确?
  • 中古汉语是否重建正确?
  • 是否符合历史汉越音?
  • 是否把例外误当成规律?
  • 是否破坏了既有规律?

正因为采用多层次评估,

Engine 才能长期稳定演进,

而不是依赖大量特例来修补结果。

比 Benchmark 更重要的事

高 Benchmark 分数固然重要,

但对历史音韵研究而言,

可解释性(Explainability)更加重要。

Quizzman Fanqie Engine 的每一个结果,

都可以追溯到:

  • 使用的反切。
  • 中古汉语音韵资料。
  • 音韵推导规则。
  • 词汇层调整。
  • 每一步推导的可信度。

因此,

使用者不只知道 Engine 如何读

更能理解:

为什么会得到这样的读音。

这也是 Quizzman Fanqie Engine 一直秉持的设计理念:

不只是提供答案,

而是建立一套可解释、可验证、可追溯的历史音韵推论系统。

下一篇

下一篇将回到一个看似简单,

却最能体现 Quizzman Fanqie Engine 设计理念的问题:

为什么 Quizzman Fanqie Engine 不是一本汉越字典?

我们将进一步探讨:

Dictionary LookupHistorical Phonology Inference Engine 的本质差异,以及 Quizzman 为何选择以历史音韵规律建模,而不是单纯储存数万笔静态读音资料。