Quizzman Fanqie Engine 系列(第九篇)
上一篇:Lexical Normalization
Quizzman Fanqie Engine 的准确率:如何评估一套历史音韵引擎?
许多人第一次接触 Quizzman Fanqie Engine 时,最常提出的问题就是:这套 Engine 的准确率是多少? 这是一个合理的问题,但并不容易回答。与 OCR、机器翻译或影像辨识不同,历史音韵引擎并非只产生唯一答案。它必须同时重建历史音韵规律、处理不同读音层次,并区分音韵规律与词汇例外。因此,评估 Fanqie Engine 并不是单纯计算「答对几个字」,而是需要一套多层次的测试与评估方法。
为什么不能只说「准确率 95%」?
评估电子字典时,
通常非常直接。
例如:
国
│
▼
quốc
如果系统输出 quốc,
即可判定正确。
若输出 quấc,
则视为错误。
然而,
对历史音韵引擎而言,
问题并没有这么单纯。
同一个汉字,
可能同时存在:
- 多种反切。
- 多种历史读音。
- 多个汉越音层次。
- 不同文献来源。
因此,
即使 Engine 的结果与现代字典不同,
也未必代表它错了。
有可能:
- 音韵推导完全正确。
- 只是现代词汇层已经改变。
因此,
Quizzman Fanqie Engine 并不以单一百分比作为评价标准。
两个完全不同的目标
Quizzman Fanqie Engine 同时追求两项彼此独立的目标。
第一个目标
音韵规律是否正确?
这就是 Pure Projection。
在这一层,
Engine 仅依据:
- 反切。
- 中古汉语。
- 音韵规律。
完全不使用任何字典资料。
第二个目标
最终读音是否符合今日通行的汉越音?
这就是 Hybrid。
除了音韵规律,
Engine 还会参考:
- 汉越音资料。
- 历史读音层。
- Thiều Chửu 字典。
- Candidate Ranking。
两者评估的是不同问题。
一个结果,
可能在音韵推导上完全正确,
却因词汇演变而与今日常见读音不同。
Pure Projection 评估什么?
Pure Projection 只回答一个问题:
如果完全依照汉越音的历史音韵规律推导,结果应该是什么?
因此,
它不考虑:
- 现代越南人如何发音。
- 字典如何记载。
- 哪一种读法最普遍。
唯一评估的是:
音韵推导是否正确。
这也是整个系统最困难的部分,
因为所有责任都来自演算法本身。
Hybrid 评估什么?
Hybrid 解决的是另一个问题。
当 Pure Projection 得出音韵结果后,
Engine 会进一步与历史汉越音资料进行比对。
若同时存在多个候选读音,
系统便综合评估:
- 反切来源。
- 是否符合音韵规律。
- 历史读音层。
- 字典资料。
- 各候选结果的可信度。
最后产生最适合的读音。
这也是 Quizzman Fanqie Engine 提供给一般使用者的预设模式。
Benchmark 如何建立?
为了客观评估 Engine,
Quizzman Fanqie Engine 并非依赖单一测试集,
而是建立多组不同用途的 Benchmark。
包括:
- Golden Fixture
- Random Corpus
- Thiều Chửu Benchmark
- Batch Regression
- Audit Corpus
- Stress Test
每一组资料,
都用来回答不同的问题。
Golden Fixture
Golden Fixture 是整个测试系统中最重要的一组资料。
其中所有汉字,
皆经过人工逐一验证。
涵盖内容包括:
- 平声。
- 上声。
- 去声。
- 入声。
- 清声母。
- 浊声母。
- 各种历史特殊案例。
Golden Fixture 的目的,
并不是提高 Benchmark 分数。
它最大的用途是:
侦测 Regression(回归错误)。
只要某次修改破坏了原本正确的音韵规律,
Golden Fixture 就能立即发现。
Random Corpus
Golden Fixture 通常规模较小。
因此,
还需要更大的测试资料。
Random Corpus 是由汉越音资料库随机抽样建立。
例如:
- Random 300
- Random 300B
主要用来评估整个 Pipeline 在接近真实情境下的表现。
目前内部测试中,
Hybrid 在此资料集上的一致率约为:
89%
值得注意的是,
Pure Projection 的一致率则低于 Hybrid。
这并不是音韵演算法较差,
反而说明今日汉越音已经历了大量词汇化(Lexicalization)的演变。
Thiều Chửu Benchmark
另一项重要测试,
是与 Thiều Chửu 汉越字典进行比对。
Thiều Chửu 是越南影响最深远的汉越字典之一。
在约一千个汉字的内部测试中,
Hybrid 与主要读音的符合率约为:
94.5%
这代表:
Lexical Normalization 能有效选择符合现代汉越音使用习惯的读法。
不过,
此 Benchmark 并不是要证明 Thiều Chửu 就是唯一标准,
而是评估 Engine 与主流资料来源之间的相容程度。
数千汉字的 Audit
除了小型 Benchmark,
Quizzman Fanqie Engine 也会在数千个汉字上进行 Audit。
不同於单纯的「正确/错误」,
系统会将每一笔结果分类,例如:
- 完全正确。
- 词汇层差异。
- 多音字。
- 拼写差异。
- 历史例外。
- 真正的音韵规律错误。
如此一来,
开发者便能明确知道问题究竟出在哪一层。
若所有案例都只标记为「错误」,
将很难有系统地改善 Engine。
最重要的指标:True Rule Error
在 Quizzman Fanqie Engine 的开发过程中,
团队并不把所有差异都视为错误。
真正关注的是:
True Rule Error
也就是:
- 音韵规律套用错误。
- 中古汉语重建错误。
- Projection 推导错误。
- 无法用历史音韵解释的结果。
这些,
才是真正需要修正的问题。
至于:
- 不同读音层。
- 多音字。
- 文读。
- 白读。
通常会交由 Lexical Normalization 处理,
而不是修改音韵演算法。
Regression Test
开发历史音韵 Engine 最大的风险之一,
就是:
修正一条规律,
却意外破坏数百条原本正确的规律。
因此,
每次重大更新后,
所有 Benchmark 都会重新执行。
若发现:
- Hybrid 准确率下降。
- True Rule Error 增加。
- Golden Fixture 出现新的错误。
该次修改便会重新检讨。
透过这样的流程,
Quizzman Fanqie Engine 能持续新增功能,
同时维持整体规律的稳定性。
准确率不只是单一数字
可以看出,
评估 Quizzman Fanqie Engine,
与评估一般查询工具有很大的不同。
与其问:
「Engine 的准确率是多少?」
更重要的是回答:
- 音韵规律是否正确?
- 中古汉语是否重建正确?
- 是否符合历史汉越音?
- 是否把例外误当成规律?
- 是否破坏了既有规律?
正因为采用多层次评估,
Engine 才能长期稳定演进,
而不是依赖大量特例来修补结果。
比 Benchmark 更重要的事
高 Benchmark 分数固然重要,
但对历史音韵研究而言,
可解释性(Explainability)更加重要。
Quizzman Fanqie Engine 的每一个结果,
都可以追溯到:
- 使用的反切。
- 中古汉语音韵资料。
- 音韵推导规则。
- 词汇层调整。
- 每一步推导的可信度。
因此,
使用者不只知道 Engine 如何读,
更能理解:
为什么会得到这样的读音。
这也是 Quizzman Fanqie Engine 一直秉持的设计理念:
不只是提供答案,
而是建立一套可解释、可验证、可追溯的历史音韵推论系统。
下一篇
下一篇将回到一个看似简单,
却最能体现 Quizzman Fanqie Engine 设计理念的问题:
为什么 Quizzman Fanqie Engine 不是一本汉越字典?
我们将进一步探讨:
Dictionary Lookup 与 Historical Phonology Inference Engine 的本质差异,以及 Quizzman 为何选择以历史音韵规律建模,而不是单纯储存数万笔静态读音资料。