一、文章主要内容总结
本文聚焦文本传统系统发育分析中存在的变体分类难题,提出并开发了一款名为Rdgai的软件包。传统系统发育方法常将所有文本变体视为等价,导致真实系统发育信号被干扰或引入偏差,而手动分类变体耗时费力,成为该类分析的主要障碍。Rdgai借助多语言大型语言模型(LLMs)实现变体过渡分类的自动化:用户先通过图形界面或Excel手动标注部分变体分类,软件以这些标注为示例构建提示词,调用LLM自动分类剩余变体,分类结果存储为TEI XML格式,可直接用于下游系统发育分析(如与teiphy软件结合适配Beast 2等工具)。文章还通过阿拉伯语福音书译本(arb)的约翰福音8:12-51文本数据集进行验证,结果显示,使用Claude 3.5 Sonnet模型时,Rdgai的分类准确率超90%,且模型选择对准确率的影响远大于示例数量。
二、文章创新点
- 自动化变体分类解决方案:首次将多语言LLM应用于文本变体过渡分类,解决了传统手动分类耗时、效率低的核心痛点,降低了系统发育分析的准入门槛。
- 灵活的分类与交互设计:支持用户自定义分类类别(含互斥类、对称类),提供图形界面(GUI)和Excel导入导出功能,方便手动标注、编辑和共享,适配不同用户的使用习惯。
- 增强分类可信度与可解释性:LLM分类结果需附带决策理由,且软件内置验证工具,生成含准确率、混淆矩阵、错误分析的HTML报告,还能通过LLM反馈优化分类定义和标注一致性。
- 无缝衔接下游分析:输出格式兼
订阅专栏 解锁全文

884

被折叠的 条评论
为什么被折叠?



