从 Middle Chinese 到拼音与汉越音:为什么 Quizzman Fanqie Engine 能从同一份资料生成多种读音系统?

Quizzman Fanqie Engine 系列 — 第 12 篇。上一篇:开发历程 · V6

从 Middle Chinese 到拼音与汉越音:为什么 Quizzman Fanqie Engine 能从同一份资料生成多种读音系统?

现今大多数工具都只针对单一目标而设计。汉越音工具只能生成汉越音,拼音工具只能生成拼音,因此每套系统都必须维护自己的规则与资料库,也难以扩展到其他语言。Quizzman Fanqie Engine 采用了完全不同的架构。它并不把汉越音或拼音视为起点,而是将 Middle Chinese(中古汉语) 作为整个系统最重要的中介层。从同一份 Middle Chinese 音韵资料出发,Engine 可以推导出不同的读音系统。因此,Quizzman Fanqie Engine 不只是汉越音引擎,更是一个历史音韵计算平台。

一个汉字不只有一种读音

对多数学习中文或汉越音的人而言,一个汉字通常只有一种读法。

例如:

| 汉字 | 汉越音 | 拼音 | |------|---------|-------| | 国 | quốc | guó | | 学 | học | xué | | 德 | đức | dé |

因此,很多人认为:

汉越音与拼音是两套彼此独立的系统。

事实并非如此。

两者其实都源自同一个共同祖先

那就是 Middle Chinese(中古汉语)


Middle Chinese 才是核心

在 Quizzman Fanqie Engine 的架构中,不存在:

汉字
 ↓
汉越音

也不存在:

汉字
 ↓
拼音

所有流程都必须经过同一层中介。

汉字
 ↓
反切
 ↓
Middle Chinese
 ↓
现代读音系统

这表示:

汉越音与拼音并不是彼此独立生成。

它们都是由同一份 Middle Chinese 音韵资料推导而来。


Middle Chinese 音韵资料包含哪些内容?

完成反切分析之后,Engine 会建立一份完整的音韵资料。

例如:

| 项目 | 值 | |------|----| | 声母 | 帮 | | 韵 | 东 | | 摄 | 通 | | 等 | 一等 | | 开合 | 开口 | | 声调 | 平声 |

这就是一个音节的「DNA」。

生成不同读音系统所需的全部资讯,都已经包含在这份资料之中。


为什么要这样设计?

假设没有 Middle Chinese 这一层。

Engine 就必须分别建立:

  • 汉越音规则
  • 拼音规则

两套系统几乎无法共享任何内容。

如果日后想新增:

  • 汉音(Kan-on)
  • 吴音(Go-on)
  • 韩汉音
  • 或其他汉语方言

几乎所有工作都必须重新开始。

这样的架构非常难以扩充。


一个中介层,对应多种输出

Quizzman Fanqie Engine 的解决方式,就是让 Middle Chinese 成为整个系统的核心。

                Middle Chinese
               /      |       \
              /       |        \
             ▼        ▼         ▼

         汉越音     拼音      其他读音系统

因此,所有读音系统都共享同一份历史音韵资料。

只要 Middle Chinese 的分析更加完善,

所有读音系统都能同步受益。


生成汉越音

生成汉越音时,Engine 会依序套用:

  • 声母规则
  • 韵母规则
  • 十六摄规则
  • 开口规则
  • 合口规则
  • Eight Tone Slot
  • Lexical Normalization

最后得到汉越音。

例如:

Middle Chinese
        ↓
     quốc

生成拼音

对于现代普通话,

Engine 不会使用汉越音规则。

而是套用普通话历史演变规律,例如:

  • 声母历史演变
  • 入声消失
  • 多个韵部合流
  • 声调的不同演化

因此得到:

Middle Chinese
        ↓
      guó

虽然结果不同,

但汉越音与拼音都源自同一份 Middle Chinese 音韵资料。


两种语言,两条演化路径

有趣的是:

汉越音与拼音并不是彼此翻译。

它们是同一祖先演化出的两条不同分支。

            Middle Chinese
                 │
      ┌──────────┴──────────┐
      ▼                     ▼
    汉越音               现代普通话
      │                     │
    quốc                 guó

不存在:

quốc
 ↓
guó

或:

guó
 ↓
quốc

两者都是独立地从 Middle Chinese 演变而来。


为什么汉越音保留了更多古代特征?

有趣的是,

许多情况下,

汉越音仍保留了普通话早已消失的历史特征。

例如:

法
 ↓
pháp

仍保留:

-p

但普通话:

已完全失去塞音韵尾。

同样的情况也出现在:

  • 德 → đức
  • 国 → quốc
  • 学 → học

因此,

汉越音在历史语言研究中具有极高价值。


不只是汉越音与拼音

有了 Middle Chinese 这一层之后,

要扩充新的读音系统就容易得多。

理论上,同一份音韵资料还可以生成:

Middle Chinese
        ↓
      汉音(Kan-on)

Middle Chinese
        ↓
      吴音(Go-on)

Middle Chinese
        ↓
      韩汉音

Middle Chinese
        ↓
      各种汉语方言

每一种读音系统,

只需要建立自己的 Projection 规则即可。

整个 Engine 不需要重新设计。


面向平台的架构

这也是 Quizzman Fanqie Engine 并非单一应用程式的原因。

它被设计成一个 Phonological Platform

Middle Chinese 扮演的是一种「中介语言」。

各种读音系统,

只是建立在这个中介层上的不同 Projection。

这样的设计可以:

  • 减少规则重复
  • 更容易测试
  • 更容易扩充
  • 更容易维护
  • 更容易进行学术研究

不只是查询工具

当 Middle Chinese 成为核心资料之后,

Engine 的用途便远远超越查询工具。

同一份音韵资料还可以应用于:

  • 音韵学研究
  • 反切分析
  • 历史字典建构
  • 汉文文本处理
  • NLP
  • AI
  • OCR
  • 古音重建

因此,

Quizzman Fanqie Engine 被定位为一个历史音韵计算平台

而不只是汉越音查询工具。


为未来而设计的架构

这套架构最大的优势,

并不在于目前支援多少种读音系统。

真正的优势在于它的可扩充性。

当需要新增新的读音系统时,

开发团队不必重写整个 Engine。

只需要建立新的 Projection Layer,

即可从同一份 Middle Chinese 音韵资料推导新的结果。

这也是 Quizzman Fanqie Engine 始终坚持的核心理念:

一份 Middle Chinese 音韵资料,多种读音系统(One Middle Chinese Profile, Multiple Reading Systems)。

正因如此,Quizzman Fanqie Engine 得以持续演进,逐步成为服务于东亚历史语言研究的计算平台,而不仅仅停留在汉越音或拼音生成工具。