StepFun音频团队的StepAudio 2.5技术报告解读

语音识别语音合成实时对话_正则生成提示词

2026年5月22日, 一项研究在预印本平台arXiv上, 以技术报告形式发布, 这项研究是由阶跃星辰音频团队(-Audio Team)完成的, 其编号为arXiv:2605.23463, 感兴趣的读者能够凭借该编号去查阅完整原文。

提起语音技术, 大概许多人的相关认知或许停留在手机当中的语音助手——你讲出一句话, 其替您分辨出文字;或是您敲入一段文字, 它助力您念诵出来。这两桩事情听着晓得简单, 但其背后隐藏着全然不一样的技术逻辑, 仿佛一个人专长听写, 另一个人专长诵读, 然而要寻觅到一个既能够听写又能够诵读、并且还能够即刻与您对话聊天的“全能选手”, 向来是行业内人士都认可的难题。

阶跃星辰音频团队进行了一份研究, 这份研究是在挑战那个“全能选手”的目标, 他们有一个系统, 这个系统叫做2.5 , 2.5系统的核心主张是, 与其去训练三个具备不同专长的专才, 不如去打造一个拥有共同“思维底座”的通才, 要让同一个模型借助不同的“工作模式”, 分别去完成语音识别这一任务, 还要去完成语音合成这一任务, 以及实时对话这一任务, 并且在每一项任务上都不会输给专门为做这件事而产生的专业系统句号。

从最终测评得出的结果去看, 这个目标实实在在地达成了, 在中英文语音识别所具备的准确率方面, 在语音合成呈现出的自然度以及表现力方面, 在实时对话展现出的流畅感和人格一致性方面, 2.5都获取到了当下公开且可作比较的系统里的最优成绩, 这究竟是怎样达成的呢, 其背后所蕴含的逻辑要远比“堆积更多的数据”或者“运用更大的模型”复杂许多。

---

一、为什么"一个大脑管三件事"这么难?

要领会这项研究的困难程度, 得先清楚这三件事当中, 每一件事自身的“脾性”, 究竟存在着多么大的差异。

专门进行语音识别的(也就是ASR)所开展的事情, 从本质上来说, 是将声音转变为文字。对于这件事情而言的判断标准是十分明晰确切的——当翻译准确无误的时候那就是正确的, 要是翻译出现错误呢那就是不正确的, 用以衡量的标准被称作“字错误率”, 自然是越低越好的。并且语音识别是格外重视速度这一方面的, 毕竟在实际进行部署的情况之下, 如果一段时长为30秒的录音需要耗费10秒的时间才能够处理完毕,那么基本上就可以投入使用了的。

语音合成, 也就是 TTS, 即 Text-to-, 情况恰恰相反, 其承担的任务是将文字转变为声音。这件事情的难点并非在于“说对”, 而是在于“说得好”, 具体表现为声音是不是自然, 合不合乎指定的情绪、风格, 听起来是不是如同真人在讲话。此类质量难以凭借一个数字去衡量, 原因是人耳对于“好不好听”的判定自身带有主观性。

实时对话, 是基于上面两件事, 又有了更严苛要求: 低延迟, 即你说完它得立刻回应;多轮连贯, 就是它得记住你们之前聊的内容;人格稳定, 也就意味着它要维持固定“性格”, 不能今儿活泼明儿沉闷;还要能读懂你声音里的情绪, 比如你叹了口气它得能察觉得到。

将这三件事强行塞入一个模型之中, 这就如同要让同一个人同时出任速记员、播音员以及心理咨询师, 这三份工作的评判标准全然不同, 其训练方式也各有侧重点。过去大多数系统所采用的做法, 乃是把这三件事交由三个独立的“专家”来分别予以处理, 并且彼此之间利用管道连接起来。这种“流水线”方式存在的问题在于, 信息在每次进行交接的时候都会出现损耗——声音里所蕴含的情绪在被转化成文字的那个瞬间, 就已然消失不见了。

2.核心主张是5: 要是文字跟声音从起始就一同共有同一个表达空间情形, 此次损耗便不会出现, 任务之间的差异, 能够借助“使用哪种数据训练、优化何种目标、运用什么解码方式”来处置, 用不着自开头设计三套各异的架构。

---

二、一个共享的"语言-声音"大脑是如何搭建的?

2.可这样来理解5的架构, 用一个相对直观化的比喻, 把它设想成一台超级翻译机, 这台超级翻译机同时连接着“耳机”与“麦克风”, 中间还存在着一个极为强大的“理解核心”。

详细来讲, 此系统由三个部分构成。首先一部分称作“声音编码器”, 它所进行的工作是将原始的声波信号予以压缩, 使其成为紧凑的声学特征向量, 这就如同把声音之中的关键的信息提取出来, 把无关的那些噪声去除掉。其次一部分名为“适配器”, 它的工作是把这些声学特征转变成语言模型能够理解的那种格式, 形象地说就如同一个转接头。第三部分, 同时也是最为核心的部分, 被叫做“大语言模型解码器”, 它是从一个专门用于处理文字的大型语言模型继承而来的, 不过经过改造之后, 不但能够处理文字, 还能够生成以及理解声音。

此设计于结构方面呈现 “不 对 称” 状态: 声响编码器功用为稳健抽取声学信息, 无需涉足语义层面理解事宜;然而解码器却肩负起近乎全部语义处理范畴、上下文管理事务、指令遵循以及生成工作诸项重任。这般“不对称”并非视作缺陷之举, 相反却是促使三个任务得以共用同一个解码器的关键所在——鉴于语义大多栖身于解码器之中, 所以不管是任务归于识别或是合成亦或是对话情形之下, 均可运用同一套关于具有语义理解的能力。

在这个共同基础上面, 对于三个任务的工作方式, 我们能够做如下这种理解: 在进行语音识别之际, 有着这样的情况出现, 那就是声音进入进来, 随后解码器输出文字, 此时输出空间狭窄并且确定, 它极度强烈地依赖声音信号所具有的约束;当进行语音合成之时, 文字以及控制指令进入进来, 接着解码器输出声音, 这个输出空间宽阔而且丰富, 其中难点之处在于怎样才能够使得声音既准确无误又悦耳动听;实时对话是二者的一种结合形式, 它同时接收声音、理解内容、生成回应, 并且需要在极为短暂的时间之内完成, 还要记住对话历史、保持人格一致。

---

三、从零开始打造共同的"语言感":预训练的完整过程

研究团队要给整个系统打下一个扎实基础, 也就是要让它切实明白声音, 与文字的关系, 在对那三个任务分别开展“专项训练”之前, 就得进行预训, 练, 此过程总计使用了二点二万亿个“词元”, “词元”可理解为文字以及, 声音片段的基本单位。

原始数据处理过程其自身就是一项工程, 研究团队构建了一套自动化数据处理流水线, 先是运用声音事件检测以及语音活动检测来过滤掉低质量非语音片段, 进而将相邻语音段落合并成语义完整、时长适宜的基础样本, 每个音频段落均需历经质量评分、合成语音检测以及说话人数量标注, 文字方面利用两套不同语音识别系统依次转写,接着交叉比对差错率、编辑距离以及语速等指标, 最终再评估语义完整性与内容类别。这套流程所产出的数据, 是按照语言来分级的, 是按照时长来分级的, 是按照语义质量来分级的, 还按照音频质量进行分级 , 在不同训练阶段, 会使用不同质量层级的数据。

预训练自身划分成四个阶段, 如同建造房屋时, 要先开展打地基的工作, 接着进行立墙的操作, 随后进行封顶的步骤, 最终实施精装修的行为。

第一阶段是称作"对齐"的阶段, 此阶段运用30亿词元的语音识别数据, 专门针对那个"适配器"展开训练, 让其学会将声音特征映射到语言模型能够理解的空间之中。在这个阶段里, 声音编码器处于冻结不动的状态, 语言模型同样是冻结不动的状态, 然而是只有适配器在进行学习的。

关键的第二期中是以重要的预练为主导情形, 模型本身所具备的词汇表被予以扩充, 添加了声音相关词元元素——从而使得模型在同时段内开始学习文字与声音这两种不同的“语言”。在该阶段所涉及的数据包含有8000亿词元的文字以及等额8000亿词元的音频部分, 声音相关的数据不单单局限于语音识别数据范畴, 其还涵盖了语音合成、语音翻译、文字与声音相互纠缠交织的续写、以及语音对话等诸多形式——在历经该阶段训练后, 模型最终被打造成一个能够真正明白“声音作为一种通用序列”的完整系统。此阶段被细致划分成两步, 第一步是运用1280亿词元来开展一次“热身”, 以此使得新引入的声音词汇以及专家网络能够稳定下来, 接着进入主训练阶段, 在主训练阶段逐步对各个组件的学习率予以调整。

第三阶段为“冷却”, 以6000亿词元的高质量数据来做收尾工作, 与此同时, 将能处理的最长序列从16000个词元扩展至32000个, 并且加入音频描述以及可控语音合成等新的数据类型, 着重致力于提升多模态质量以及长文本处理能力。

这套训练过程的最终得出的结果, 是使得模型构建起文字与声音之的“操作接口”, 这里指的不单单是简单的对应关系, 而是切实理解了怎样在声音与文字之间进行切换, 进行转化, 以及进行推理, 这个接口, 后来被三个分支分别朝着不同方向加以利用。

---

四、语音识别分支:如何让"识别"又准又快?

仅就语音识别这一事情而言, 依照只需看过往准确率状况, 实际上已然存在不少系统成功达成相当不错水平。在语识别这个方向里其真正具有创新性之处在于, 同时将“准”与“快”这两个目标予以解决, 特别是关于“”快“的方面, 它运用了一种被称之为”多词元预测“(MTP, Mulit - Token)的技术手段, 致使每一次运算都能够同步输出多个词元, 并非是逐个依次缓慢进行。

此处要先对语言模型“生成文字”的基本方式予以解释。传统来讲, 语言模型每次仅预测下一个词, 随后将该词添加至上下文当中, 接着再去预测再下一个词, 这般循环往复。这恰似一个人打字, 每次仅仅敲打一个键, 打完一个字过后才能够着手打下一个字。MTP的思路是, 在每次运算之际额外“猜”未来几个词, 要是猜对了便一次性接受, 从而省下了多次运算所需的时间。

但于自由写作的情景当中, 往后的词不大容易捉摸准确, 缘由在于语言有着数目众多的走向。语音识别存在差异, 声音信号的存有, 极大地压缩了可能性的范围。一段已然录制好的音频, 其文字转写大体是确定的, 因而“猜”往后的词准确率会高出许多。研究团队将这个现象称作“声学确定性”, 正是借助了这种确定性, MTP在语音识别方面能够展现出比自由文本生成大得多的提速成效。

从技术实现的层面而言, 可以这么说, 针对于2.5ASR来讲, 它是与主有所差别, 区别就在于它在主解码器的基础之上, 并联设置了5个MTP模块, 这5个MTP模块, 每一模块所负责的任务是预测未来第1到第5个词元。在进行推理的阶段, 系统会首先让主解码器按照正常的环节运行起来, 与此同时, 还要对MTP模块的预测结果予以查看, 要是预测出来的结果是彼此吻合的, 那么就予以接受, 要是在哪个位置上预测结果吻合不上, 那就从那个位置进行截断, 然后回到逐个生成的模式当中。正是这样一种用以验证的机制, 才确保了MTP仅仅只是“加速工具”, 无论如何都不会导致最终准确率出现降低的情况。

第一步, 训练这个模块是这样的, 要先冻结主解码器, 然后只去训练5个MTP模块, 目的是以这种方式令其学会着与主解码器的分布实现对齐;第二步, 还要将解码器进行解冻, 之后开展联合微调操作, 借此来消弭主干和预测模块之间所残余的不匹配情况。5个分支的损失权重按照等比数列进行衰减, 而如此这般就反映出了越远的预测越发具有不确定性这样一个事实。

从数据角度而言, 语音识别这块的分支当中, 运用了大概10万小时的短形式监督类数据, 这些数据覆盖有普通话, 还有英语, 以及频繁出现的中英混合着的语音, 其中涵盖多个垂直行业的专业术语, 并且包括远场录音等复杂声学环境, 还有高噪声等复杂声学环境。长形式数据额外构建了5万小时, 采用了一套三系统投票的流水线, 每段音频依三个各异的语音识别系统分别独立转写, 而后依靠ROVER算法进行词元级投票, 唯有至少两个系统一致认可的词元才得以留存, 不一致率超5%的片段予以舍弃, 剩余片段拼接成了长形式样本, 最后运用大语言模型来处置: 标点恢复, 逆向文本归一化以及跨片段实体一致性处理。

中文方面结果可以视为“相当亮眼”, 平均字里的错误率降低成为这个2.97%的数值, -1这个数值上仅仅只有0.71%;英文方面呈现别样情况, 平均词错误率是这个3.68%, 干净测试集里能达到1.38%;长形式测试集上平均错误率为3.70%,相比主要竞争对手明显更具优势。更关键的是实时率(RTF, 也就是处理时间与音频时长的比例)——处理当中一段30秒存在的音频, 2.5这个时长只需要0.16秒, RTF是0.0053, 比所有参与比较的系统速度都更快, 尽管存在解码器规模更大的情况。MTP所具备的加速效果, 是历经了实验得到的验证, 在前面5个位置那儿, 其接受率依次仿佛为约0.95、0.88、0.80、0.71、0.64这么些数值, 在平均的状态下, 没走一步就会接受5个词元(在这之中有着满分6个词元设定上限), 其带来的加速效能实际上是大大地超过了针对任何单纯凭借扩大模型规模而来的方案。

---

五、语音合成分支:让机器"说话"有温度、有情绪

语音合成的这个分支, 于架构方面做了一项饶有趣味的抉择, 它将声音编码器与适配器全然去除, 致使整个系统仅余语言模型解码器, 声音词元被视作一种全新的“语言”而直接归入语言模型的序列中, 语音合成因而被再度界定为一个纯粹的“下一个词元预测”任务, 只是其中的“词”, 既能够是文字, 亦可以是声音片段。

此设计的关键挑战在于, 怎样使模型领会“如何表达” , 并非仅仅是“表达的内容”。给予模型的不单单是要朗读的文字 , 况且有阐述说话格调 、情绪 、语速 、停顿等特性的控制命令 , 并且还包括参照说话者的声音样本 (用于零样本声音克隆)。模型得将这些不同层面的信息进行融合 , 进而生成契合要求的声音词元序列。

训练划分成两个主要阶段, 第一阶段是监督微调, 也就是SFT, 它又进一步分为两步, 第一步是运用大规模合成数据开展全局指令控制训练, 从而使得模型能够学会依据描述整体风格的指令去生成相应的声音, 第二步是利用经过精细标注的人声录音数据, 训练同时涵盖全局指令以及局部表达指令的联合控制, 以此让模型可以在一句话里的不同位置做出不同的表情变化。

关于局部表达指令的数据构建进程, 那相当精细。研究团队是从具备对话背景或者剧本条件的内部录音着手的, 先是运用-Large-v3进行转写操作, 接着利用蒙特利尔强制对齐工具从而获得词级的时间戳, 然后将其切分成话语级的样本。在过滤掉那些对齐误差极为严重、转写存在不完整情况或者时长过于短浅的样本之后, 针对每一段留存下来的录音, 对其中的基频(F0)、语速、停顿统计状况、频谱重心、均方根能量、MFCC方差以及谐波噪声比等声学特征进行了提取以及量化。把这些被量化的声学特征, 与转写文字以及对话背景元数据拼接一块儿, 送给一个大语言模型, 要求这个模型去输出两种标注, 一种标注是用来描述整段话整体说话风格跟情感状态的全局控制描述, 另一种标注是在文字内部插入了段落级表达指令的局部表达描述, 这两种标注共同打造出了精细化表达控制的训练数据。

第二阶段是强化学习, 也就是RLHF。此阶段的核心工具是一个称作“生成式奖励模型”的GRM, 对于每一个输入提示词, 训练数据给出一个高质量的参考回应, 策略模型, 便是那个被训练的语音合成模型, 生成一个候选回应, 奖励模型将候选回应与参考回应放在一块比较, 输出一个标量分数, 以此表示候选回应相较于参考回应的质量高低, 这个分数经过变换后作为强化学习的奖励信号, 用来优化策略模型。该机制使得模型能够于“比较好不好”的反馈里展开学习, 并非仅仅是从“这便是正确答案”的监督之下进行学习, 尤其擅长应对复杂的、抽象的、依赖上下文的表达指令。

有一个“擂台赛式”的成对比较框架被用于评测, 此框架要点是两两进行对比, 这样每场比赛都会由人工评审去判断究竟哪个系统所输出处的内容会更好, 最终借助胜率来对综合表现予以衡量。参与比较这件事的对手范围内, 包含了-2.8-HD、-v3以及-3.1-Flash-TTS这三个当前阶段最具竞争力的系统。也不能少。首先, 评测流程自身是经过严格设计的, 先是要做听觉敏感度筛选以此来选定评审员, 一旦评审员确定下来之后就不会再进行更换, 模型音频对的选取以及排列顺序是随机化的, 评审员要给出偏好理由, 全程要做周期性抽查, 结束之后对分歧较大的案例做额外核查。最终结果表明, 2.5 TTS对 -2.8 -HD的胜率是63.0%, 对 -v3的胜率是80.0%, 对 -3.1 -Flash -TTS的胜率是59.4%, 综合胜率达到69.1%。

---

六、实时对话分支:一个有个性、有情绪感知的"说话大脑"

这个实时对话的方向, 是三个任务之中挑战最为复杂的, 它不但要求“听懂”以及“说出来”, 而且还要在毫秒级的延迟范围之内达成理解、推理以及回应, 与此同时维持多轮对话的连贯性、固定不变的人格特征, 还有对用户声音里情绪与状态的感知。

研究团队划分这些挑战性, 涵盖四个维度, 其一为对话连贯性, 即多轮之间主题与状态需保持一致, 其二是人格一致性, 即在各类用户输入状况下, 要维持设定的性格特性, 其三乃副语言敏感性, 也就是识别并对迟疑、笑声、叹气、语速变化等非语言信号予以回应, 其四是奖励稀疏性, 即对话质量欠缺单一明确的正确答复, 难以凭借简单的对错去进行衡量。

用来应对这些挑战的训练流程, 分成三个阶段, 然而并不涉及任何架构方面的改动, 并且所有工作都是在训练策略还有数据之上得以完成的。

音频感知能力扎实, 长文本推理能力具备, 第一阶段继承自基础预训练, 此阶段称为“以音频为中心的中间训练”, 作为对话专项训练展开之前所需要的起点。

第二个阶段是渐进式监督微调, 它沿着三个维度系统地去注入对话能力。在对话对齐这一块儿, 运用了包含丰富指令的多轮对话数据, 以此训练模型怎样保持轮次连贯性, 怎样处理口语里的不流利现象, 像重复、打断、半句话中途改变这类情况, 还要让模型偏好口语化、适合发音的回应, 而不是书面化表达。在人格与风格控制这一方面, 研究团队先是人工撰写了超过10000个原生人格, 接着对这些原有人格进行审核, 之后借助算法“裂变”过程, 将性格、口头习惯、情感边界以及互动风格等多个维度的不同属性重新组合到一起, 进而生成了百万级别的人格矩阵, 并且每个合成的人格都与来自真实场景语料库的对话进行了配对, 以此来确保人格属性有着真实的交互背景作为支撑。在利用副语言敏感性之时, 运用了带有已标注的“氛围描述符”的真实口语对话数据, 这其中的“氛围描述符”控制着语速、重音以及潜台词, 同时还囊括拥有具体的特定副语言线索标签的真实口语对话数据, 这些标签包含迟疑、轻笑、叹气、呼吸声、节奏变化、尾音下降等等, 借助这些数据, 使得模型能够学会在推理链里记录这些线索, 并且依据这些线索来调整回应的语气以及节奏。

研究团队采用了“动态复习计划”, 目的是防止在逐步注入新能力的进程里遗忘旧能力, 怎样采用的呢, 是依据验证指标持续将对话专项数据、通用指令数据以及推理任务混合交替来训练。

第三个阶段是有着生成式奖励的强化学习, 运用PPO(近端策略优化)算法加上KL散度正则化, 奖励信号源自两个方面, 一方面是生成式奖励模型针对候选回应与参考回应进行成双成对的比较, 从而捕获整体回应质量, 另一方面是显式互动评分标准, 它专门就需要一致性以及忠实度的那些方面而言, 像跨轮次维持连贯、不违反用户先前讲过的东西, 生成式奖励模型相较于传统的标量奖励模型能够捕获更为细粒度的人类偏好。这种训练数据, 混合了多轮对话, 此种多轮对话能促进跨轮次一致性, 还进而混合了单轮提示词呵, 仅这单轮提示词就允许更长的推理, 可以有更丰富的偏好表达。

评测采用了主观与客观这两种方式, 它覆盖五个测试套件, 其中包括, 借助手机应用开展的, 主观真人评测, 也就是Step--Human-Eval, 还有通用对话的, 客观API评测, 为l, 以及车载场景对话的, 客观评测, 是step--car, 另外还有用于测试模型, 能否从声音信号, 直接推断年龄、性别、语速等特征的, 对话理解测试。

步骤二, 87个样本), 还有包含11个类别的音频问答基准(步骤-SPQA)。参与作比较的系统有GPT-1.5、-直播-和豆包-。2.5在全部五个套件上都是排名首位: 在主观人工评测方面以80.41分领先第二名10分, 在步骤-SPQA上以79.80分领先第二名16.6分, 在通用对话、车载对话以及对话理解上的优势也都极为显著。

---

七、一个系统,三种能力,它意味着什么?

说到最后, 这项2.5相关的研究中, 最值得被记住的东西里, 并非是某一个具体存在的技术要点, 而是这一研究所证实的一桩事情, 即一旦文字以及声音切实共享了同一个具备理解性质的空间, 那么让系统变得“专业”这件事, 就不再属于架构方面的问题, 而是关乎训练方式的问题了。

这个思路跟以往的做法存在着根本性的差异, 以往的做法是, 依据语音识别所需来设计架构, 再有若语音合成需要什么便设计什么架构, 要是实时对话需要什么那就再专设一套架构, 这种方式所付出的代价是, 每增添一个任务就得重新构建整个系统, 并且各个系统之间的信息没办法实现流通,2.5的做法是, 先搭建一个足够优质的通用理解基础,接着运用不同的训练目标、数据以及解码策略, 将此番基础分别加以“调校”从而形成三个工作模式。

这同样表明, 要是未来存在增添第四个、第五个与音频关联的能力这种情况, 并非要从起始点去设计全新的系统, 仅仅只需在同一基础之上开展新的调校。这便是此项研究针对整个语音AI领域所具备的更为长远的意义之处。

当然, 这项研究并非不存在未被言明的局限, 其一, 三个分支于实际部署时依旧是独立运行的, 所共享的是预训练权重, 而非实时的心推状态;其二, 评测里所使用的部分基准是该研究团队自行搭建的, 其独立可验证性有待进一步予以确认;其三, 实时对话的评测规模相对而言较为有限, 大规模真实用户反馈尚需时间来进行积累。

对于普通用户来讲, 这项研究的近期影响力, 最有可能体现在两个层面: 其一, 语音助手以及实时翻译类应用的体验获得改善, 这是因为底层系统处理速度得以更快些, 并且对情绪和口语的理解更为出色;其二, 有声读物、配音, 还有客服等依赖高质量语音合成的场景, 或许会应用上更自然、更具表现力的合成声音。

对深入了解技术细节怀有兴趣的读者, 能够借助arXiv编号2605.23463寻觅到完整的技术报告。

---

Q&A

Q1: 2.5的语音识别速度为什么比其他同类系统快那么多?

A: 2.5语音识别速度快, 其核心在于一项名为“多词元预测”(MTP)的技术。传统语音识别模型每次仅能输出一个词, 然而MTP让模型每次能够同时“猜测”后续5个词, 一旦猜对便会一次性接受, 从而省去了多次重复的运算。鉴于语音识别有录制好的音频作为参考, 未来的词相对容易猜准, 所以MTP在该场景中格外有效。在实测中, 处理一段30秒的音频仅仅需要约0.16秒, 实时率(RTF)仅为0.0053, 并且准确率几乎没有受到影响。

Q2: 2.5 TTS和、这些系统相比,优势在哪里?

2.5 TTS在人工评审之中的成对比较里, 针对-v3的那胜率达到了80%, 针对-2.8-HD的则胜率是63%, 针对-3.1-Flash-TTS的胜率为59.4%, 综合一起的胜率是69.1%。其主要优势是体现在对于复杂表达指令的理解这方面——它能够于一段话的不一样位置做出不一样的情绪以及语气的变化, 并非只是整体风格的控制, 这是因为引入了局部表达标注数据以及基于人类偏好所进行的强化学习训练。

问题3: 2.5, 它要怎样才能够做到, 在持续维持“人格一致”这种状态的情况之下, 还可以去感知用户情绪呢?

研究团队针对这两件事, 运用不一样的数据予以解决, 之后借助渐进式课程训练, 将它们融入同一个模型之中。人格一致性源自百万级的“人格矩阵”数据, 此数据把性格、口头习惯等属性重新进行组合, 从而形成大量虚拟人格, 并且为每个虚拟人格配备真实场景对话来加以训练。情绪感知则是来源于进行了标注的真实口语录音, 这些录音标注了迟疑、笑声、叹气等副语言线索。这两者在模型的“思维链”, 也就是推理过程里, 均留下了痕迹, 进而使得模型在生成回应之前, 能够先“意识到”用户的情绪状态, 再依据此去调整语气。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值