《大话文渊慧典》:外三篇-日本人认草书,韩国人封数据,美国人狂砸钱:古籍OCR的世界地图

——大胖老师:“二黑,你跑过那么多地方,用一句话概括各国古籍OCR的特点,怎么说?”

——二黑不假思索:“日本人能把草书认成印刷体,韩国人把数据锁得比军火库还严,美国人呢,钱多得能砸死问题,但问题太皮实,砸不死。”

——小菜:“那咱们中国呢?”

——二黑推了推眼镜:“咱们是满汉全席的食材,大排档的厨房,米其林的野心,但目前还在煮方便面。”

——大胖老师一口枸杞茶差点喷出来:“二黑你今天怎么回事,比喻密集得跟机关枪似的。”

一、二黑的世界地图

二黑从美国回来后,大胖老师交给他一个任务:把全球古籍OCR的技术格局梳理清楚,给实验室做一个内部报告。二黑熬了两个通宵,拿出一份被他称为《古籍OCR全球态势感知》的PPT。这份PPT后来在圈内小火了一把,被好几个高校的图书馆请去分享。它的精髓,是一张手绘风格的世界地图,上面标注了几个主要“玩家”的绝活和槽点。

二黑把地图投在屏幕上,小菜凑过去看,只见上面画得花花绿绿:

  • 日本区域画了一幅草书,旁边标注:“假名都能认,汉字差点意思。”

  • 韩国区域画了一道大铁门,门上挂了三把锁,标注:“数据是国宝,可惜不出门。”

  • 美国区域画了一台印钞机,正哗哗地往一个叫“古籍数字化”的坑里撒钱,标注:“钱能解决的问题都不是问题,问题是古籍OCR不是光靠钱就能解决的。”

  • 欧洲区域画了一座精雕细琢的钟楼,标注:“标准化做到极致,但中文古籍还在排队等叫号。”

  • 台湾地区画了一个精美的展示柜,标注:“精品中的精品,但产量低得像手工作坊。”

  • 中国大陆区域画了一锅沸腾的火锅,标注:“什么食材都有,火也旺,但缺一个好锅底。”

大胖老师看完,哈哈大笑:“二黑,你这地图拿到学术会议上发表,估计能拿个最佳可视化奖。不过玩笑归玩笑,里面的门道你得讲清楚。今天咱就按你这张地图,一个国家一个国家地扒。”

二、日本:草书都能认,但遇到中文异体字就变成了“大预言家”

二黑在日本待过两个月,专程去国立国会图书馆考察过NDL OCR。他讲起日本的古籍OCR,表情既钦佩又带点微妙的揶揄。

“日本的古籍数字化,起步比我们早,至少领先十年。他们最大的成就是什么?手写体识别做到了极致。特别是变体假名——一种日本特有的草书字符,写法变化多端,人眼看都费劲,NDL OCR能认到90%以上。还有江户时代的候文(一种书信文体),连笔潦草得跟心电图似的,他们的模型也能输出通顺的文本。这背后是十几年的积累,模型是一点一点用大量标注数据喂出来的。”

小菜啧啧称奇:“那中文古籍不也一样吗?汉字也是他们的文字啊。”

二黑摇头:“你犯了一个经典的误解。日本古籍里的汉字,和中文古籍里的汉字,重合度虽然高,但使用习惯和字形分布差别巨大。我举个例子——‘国’字。日本现代用‘国’,古籍里偶尔用‘國’。但中文古籍里,‘國’字有几十种写法:囯、囻、囶、国、䆐……有些是俗字,有些是避讳字,有些是刻工随手省了几笔。日本模型只见过标准的‘国’和‘國’,碰上‘囻’,它直接蒙了——最常见的情况是输出一个假名,或者干脆跳过,假装那个字不存在。更别说中文古籍里的避讳缺笔字了。康熙缺‘玄’,乾隆缺‘弘’,这些政治正确导致的字形变异,日本古籍里几乎没有,模型自然没学过。”

“所以,”大胖老师总结,“日本是‘认自己的字,让别人乱码去吧’。他们的优化方向是日语中心,中文是附带品。能用,但别指望精准。”

三、韩国:数据锁得比核密码还严,技术再好也不给你看

韩国的情况,二黑是通过文献和几次国际会议的侧面了解拼凑出来的。不是因为他不努力,而是韩国在这方面的封闭程度,堪称全球之最。

“韩国古典翻译院有一个很厉害的系统,叫Hantopia,专门用于处理韩国汉文古籍——韩国古代文献大量使用汉字书写,包括《朝鲜王朝实录》《日省录》这些国宝级的文献。他们从上世纪九十年代就开始搞数字化,投入巨大,据说OCR准确率极高,还能自动标注人名、地名、官名,甚至做了初步的句读。但问题是——”二黑竖起两根手指,“第一,不公开。第二,不开源。第三,不提供API。第四,连学术交流都只给看演示视频。”

小菜不解:“为什么呀?技术分享不是好事吗?”

二黑推了推眼镜:“我分析有几个原因。一是数据主权意识极强,他们觉得古代文献是民族记忆,不能假手于人。二是担心版权和滥用,怕自己辛苦数字化好的文本被别人爬走。三是——我不负责地猜测——可能也有点‘不愿为人做嫁衣’的心态。毕竟汉文古籍也是东亚共同的文化遗产,韩国花了大力气整理好,免费开放给中国学者用?他们估计不乐意。结果就是,全世界都知道韩国做得好,但没有人知道他们到底怎么做的。他们的古籍OCR,就像38线北边的山——你知道那儿有东西,但你看不见。”

大胖老师感叹:“这不叫技术壁垒,这叫技术碉堡。把自己保护得好好的,但也把自己锁得死死的。我们虽然做得晚,但从一开始就定了开源开放的基调。开放不一定能赢,但封闭迟早会输。因为数据可以锁,但算法是锁不住的。全世界都在进步,你关起门来称王,早晚被人从外面敲开。”

四、美国:钱不是问题,问题是花钱的方向不太对

讲美国之前,二黑先放了一张图片:哈佛燕京图书馆的数字化工作室,一排高端扫描仪,冷光源,自动翻页装置,看起来像科幻电影里的实验室。

“美国佬是真有钱。”二黑感叹,“光哈佛燕京一个馆,每年古籍数字化的预算就有200多万美元。扫描仪是定制的,几十万一台,一买就是好几台。他们还有专门的数字保存部门,负责数据备份、格式迁移、长期可读性保障。流程之规范,标准之严格,让你肃然起敬。但他们的钱,七成以上花在了硬件、扫描外包、元数据著录这些外围环节上,真正投给OCR核心技术研发的比例,不到10%。甚至不到5%。”

小菜问:“为什么?他们不是有最牛的AI吗?”

二黑说:“问题就出在这个‘最牛的AI’上。美国最顶尖的AI人才,都被谷歌、微软、OpenAI用年薪百万美金挖走了,谁愿意跑到图书馆搞古籍?所以哈佛只能买谷歌N年前开发的通用OCR。钱砸进去,解决的是扫描和元数据问题,核心的识别质量一直是个短板。”

二黑接着讲了另一个例子:美国国会图书馆的“美国记忆”项目,数字化了几百万件历史文献,包括大量19世纪的中文移民档案和华侨报纸。但他们的OCR引擎对中文完全是外行,移民档案里的手写汉字几乎全军覆没,报纸的竖排也乱成一团。后来他们自己想了个办法——众包。把识别不了的文字图片发到网上,让志愿者来辨认和录入。效果倒是有一点,但速度极慢,一个汉字可能要等好几天才有人认出来。

大胖老师点评:“美国人解决问题的思路一向是‘用钱砸’。但古籍OCR不是砸钱就能砸出来的,它需要的是领域知识的长期积累、大量高质量标注数据的沉淀、还有一群愿意坐冷板凳慢慢调参的工程师。这些,光靠钱买不来。而且美国在中文古籍OCR上的投入意愿明显不足——毕竟不是自家的核心文化,再重视也隔了一层。”

五、欧洲:标准制定了一箩筐,中文古籍还在排队

欧洲的情况,大胖老师亲自补了一段。他在2019年去欧洲参加过一次数字人文会议,印象极深。

“欧洲的数字图书馆——像Europeana——强在哪?标准。Dublin Core、METS、ALTO、TEI,他们制定了一整套数字化元数据标准,精细到你一本书的每一页、每一行、每一个字的坐标都能结构化存储。全欧洲几千家图书馆和文化机构,用同一套标准描述数字资源,跨库检索丝般顺滑。这是他们最厉害的地方,必须服气。”

“但弱在哪?弱在他们的标准体系里,中文古籍是个边缘体。Europeana收录的中文文献数量,加起来可能还不如我们一个省馆。原因很简单:欧洲的主流文字是拉丁字母,他们的整个数字化技术栈——从扫描参数到OCR引擎到元数据规范——都是围绕拉丁字母设计的。中文?那是遥远的东方异类。所以欧洲的数字人文圈子虽然牛,但中文古籍对他们来说,始终是‘别人家的事’。不是不友好,是顾不上。”大胖老师比喻道:“欧洲就像一座精装修的宫殿,里面家具摆放得整整齐齐,标注得明明白白。但宫殿里留给中文古籍的房间,小得像个杂物间。”

六、中国台湾省:精雕细琢的“手工作坊”

台北故宫和台湾“中研院”的古籍数字化,二黑在之前的分析中已经提过。这次他用了“手工作坊”这个比喻。

“他们做的不是大规模工业化生产,是量身定制的高级定制。一年就做几百件,每件都精雕细琢:超高像素扫描、多光谱成像、专业级OCR、人工逐字校对、印章识别、笔迹分析……做出来的确实是艺术品。清代奏折的馆阁体识别准确率据说达到95%以上。但问题是,这套工艺没法推广。成本太高,系统封闭,只服务自己的精品馆藏。对于大陆面临的几千万册古籍的规模化数字化需求,这套模式没有参考价值。他们是劳斯莱斯定制工厂,我们需要的是五菱宏光生产线——皮实、能装、哪都能修。”

七、中国:满汉全席的食材,需要一个好厨师

终于轮到讲中国。二黑在地图中央画了一个巨大的圈。

“我们的优势是什么?第一,体量。几千万册古籍,全世界最大的中文文献存量和增量,数据源天然是我们的。第二,技术储备。PaddleOCR的开源社区已经把中文OCR的基础模型做到了世界领先水平,我们的‘文渊慧典’正在这个基础上做古籍领域的深度适配。第三,需求端的觉醒。从国图到县馆,从学者到民间爱好者,古籍数字化的需求正在以前所未有的速度释放。这是食材、火候、市场,什么都有了。”

“我们的劣势呢?”小菜追问。

二黑伸出三根手指:“第一,积累不够。人家干了二十年,我们大规模起步不到十年。第二,协作不够。北大一套,浙大一套,国图一套…………——各家都有独门绝技,但各做各的,不成合力。第三,落地不够。很多技术还停留在实验室和论文里,没有变成王大姐能用的工具。”

大胖老师接过话,语气变得严肃:“所以‘文渊慧典’不仅是一个工具,更是一个信号——我们开始把技术送下基层,送到每一个需要它的地方。不需要百万预算,不需要博士团队,一台电脑,一个软件,就能开始干。只有到了那一天,这张世界地图上,中国的标记才能真正亮起来。”

八、尾声:下一张世界地图什么样?

报告结尾,二黑把当前的世界地图定格,然后翻到下一页PPT。上面是一张全新的地图,许多标记都换了位置。

他说:“这是我个人预测的未来五年格局。日本会更精细化,但中文瓶颈仍然无解;韩国可能会选择性开放部分成果,但整体方向还是保守;美国的资金和技术会进一步集中在AI大模型上,古籍OCR会被大模型覆盖一部分,但准确性和专业性仍有短板;欧洲,对不起,中文古籍可能还是排不上号;我国台湾省会继续保持精品路线。而中国——”

他把中国的标记从一个沸腾的火锅,改成了一个信号塔。信号塔四周,无数个小点正在亮起。

“中国可能会走出一条完全不同的路:不是砸钱,不是封闭,不是手工作坊,而是用开源协作的方式,把全国甚至全球的开发者、馆员、学者都动员起来,用最低的成本,覆盖最广的领域,把古籍OCR做成数字世界的基础设施。这是我们唯一能走通的路,也是最符合中国国情、最有可能后来居上的路。”

小菜看着那张全新的地图,忽然觉得,自己正在做的事情,比想象中更大。

大胖老师端起保温杯,对二黑说:“你这个地图,以后每更新一次,我请你喝一次茶。”

二黑面无表情:“老师,您那个枸杞茶,我真的喝够了。”

大胖老师:“那请你喝咖啡。”

二黑:“美式,不加糖。”

小菜:“我也要。”

窗外,夜已经深了。实验室的灯还亮着,三颗脑袋凑在一张世界地图前,讨论着下一站,该往哪个坐标投下代码的种子。

本文为注水技术版,您看看即可,不必当真,写此文字就是图一乐:-)

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值