重建中古汉语:Quizzman Fanqie Engine 的核心

系列:Quizzman Fanqie Engine(第四篇)

上一篇:〈汉越音如何形成:从唐代长安到现代汉越音〉

重建中古汉语:Quizzman Fanqie Engine 的核心

若要正确推导汉越音,就不能直接由反切推到现代越南语。两者之间存在一个极其重要的中介层──中古汉语(Middle Chinese,中古汉语)。它所反映的是《切韵》《广韵》等韵书中的音系,也是理解汉越音、汉音(日语)、汉韩音以及现代汉语各方言之间关系的重要基础。在 Quizzman Fanqie Engine 中,重建中古汉语并不是附加功能,而是整个系统最核心的一环。

为什么必须重建中古汉语?

一个经常被提出的问题是:

如果最后目的是推导汉越音,为什么不直接把反切转成汉越音?

乍看之下似乎合理。

既然反切已经保存了读音资讯,为何还需要增加一层中介?

答案就在于反切的本质。

反切并不是直接记录汉越音

它所描述的是中古汉语的音系结构(Phonological Structure,音系结构)

因此,反切与汉越音并不属于同一层资料。

反切
 │
 ▼
中古汉语(Middle Chinese)
 │
 ▼
汉越音

中古汉语正是连接两者的桥梁。

若省略这一步,Engine 几乎失去所有解释能力,也很难扩展到拼音(Pinyin)或日语汉音(Kan-on)等其他读音系统。


什么是中古汉语?

在历史语言学中,中古汉语(Middle Chinese,中古汉语)是对隋唐时期音系的学术名称,其主要依据包括《切韵》《广韵》等韵书。

需要注意的是:

中古汉语不是现代普通话。

它也不是曾经被完整录音保存的一种方言。

它是一套透过历史文献重建(Reconstruction,重建)而成的音系模型。

学者主要利用:

  • 反切
  • 韵部
  • 韵文
  • 现代汉语方言
  • 汉越音
  • 汉音(日语)
  • 汉韩音

等资料,反向推导出一千多年前的语音系统。

因此,中古汉语是一个科学模型,而不是今天仍然存在的自然语言。


反切记录的是音系,而不是读音

许多人误以为反切直接记录读音。

事实上,它记录的是音系之间的关系

例如:

德红切

它并没有直接告诉我们目标字如何发音。

它只是表示:

  • 取「德」的声母
  • 取「红」的韵母与平声

若要真正得到完整音节,仍需知道:

  • 德属于哪一个声母
  • 红属于哪一韵
  • 该韵属于哪一摄
  • 属于第几等
  • 开口还是合口
  • 属于哪一声调

因此,Engine 必须先重建中古汉语。


音系档案(Phonological Profile,音系档案)

在 Quizzman Fanqie Engine 中,每一条反切解析完成后,都会建立一份音系档案(Phonological Profile,音系档案)

它并不是单纯文字,而是一组具有结构的属性。

例如:

| 属性 | 值 | |------|----| | 声母 | 见 | | 韵 | 庚 | | 摄 | 梗 | | 等 | 二等 | | 开合 | 开口 | | 声调 | 平声 |

这组资料几乎完整描述了一个中古汉语音节的音系特征。

Engine 接着才开始重建实际读音。


中古汉语并没有唯一重建方案

过去一百多年来,许多语言学家都提出过不同的中古汉语重建系统,例如:

  • Bernhard Karlgren
  • Edwin Pulleyblank
  • William Baxter
  • Baxter–Sagart
  • 郑张尚芳
  • 李方桂

这些方案大致相同,但仍存在差异,例如:

  • 声母音值
  • 元音表示方式
  • 半元音
  • 部分特殊韵母

因此:

中古汉语不存在唯一且绝对正确的答案。

它是一个持续修正与完善的学术模型。


为什么 Quizzman 不依附单一学派?

许多汉越音工具都直接采用某一位学者的重建方案。

Quizzman Fanqie Engine 并非如此。

Engine 更重视的是:

音位关系(Phonological Relations,音位关系)

而不是某一套 IPA(International Phonetic Alphabet,国际音标)记号。

例如:

见

↓

见系声母

比写成:

k

kj

kjə

更加重要。

韵母亦是如此。

Engine 储存的是音系结构,再依需求选择不同表示方式。

因此,即使未来改用新的重建方案,也不需要重写整条推导流程。


重建资料库的角色

对于已有成熟研究成果的反切,

Engine 会优先使用已验证的重建资料。

其优点包括:

  • 降低误差
  • 保持表示一致
  • 避免重复计算

资料库只是辅助,

并非唯一真理。

若遇到资料库尚未收录的反切,

Engine 仍可依照:

  • 声母
  • 开合
  • 声调

自行推导合理的中古汉语音节。

这正是:

资料库(Database,资料库)

Rule Engine(规则引擎)

最大的差别。


当资料不存在时

Quizzman Fanqie Engine 的设计目标之一,就是能处理大量罕见汉字。

即使某条反切不存在于任何资料库,

Engine 也不会停止。

它会依照音韵规则,自行重建合理的中古汉语音节。

也就是说,

Engine 并非只是记住资料

而是真正具有推理能力(Inference,推理)

这正是计算模型与查询表最大的不同。


中古汉语是所有读音系统的共同核心

完成中古汉语之后,

便可以推导不同读音系统。

             中古汉语
          /     │      \
         ▼      ▼       ▼
     汉越音   拼音   其他读音系统

这样的设计具有两个重要优点:

第一,

所有音系规则只需建立一次。

第二,

若未来增加:

  • 汉音(Kan-on,日本汉音)
  • 吴音(Go-on,吴音)
  • 汉韩音(Sino-Korean,汉韩音)
  • 现代汉语方言

只需增加新的映射层即可,

完全不必修改中古汉语重建流程。

这是一种高度可扩充的架构。


中古汉语不是最终目的

值得注意的是,

Quizzman Fanqie Engine 并不是为了向使用者展示一套漂亮的中古汉语拼写。

中古汉语真正扮演的是:

中介语言(Intermediate Representation,中介表示)

正如编译器会先把原始程式转换成中介表示(Intermediate Representation,中介表示),再生成机器码,

Fanqie Engine 也会先把反切转换为中古汉语音系档案,再推导汉越音。

透过这一层,

音韵规则便能与各种读音系统完全分离。

因此,

Quizzman Fanqie Engine 不只是汉越音查询工具,

更是一套可支援多种研究方向的计算音韵学平台(Computational Historical Phonology,计算历史音韵学)


从中古汉语到汉越音

完成中古汉语重建后,

工作其实才完成一半。

接下来更大的挑战是:

  • 中古声母如何演变成越南语声母?
  • 为何相同韵部会发展出不同的汉越韵母?
  • 中古四声如何演变为越南语六声?

这些问题将在下一篇文章:

〈汉越音推导演算法:从声母、韵母到现代汉越音系〉

中继续深入介绍。