|
|
腾讯开源了一个叫 AuK 的语音处理框架。它做的事说起来简单:把过去要分开跑的语音生成、编辑、增强、分离,塞进同一个模型里。
输入格式也统一了——指令、音频、目标,三样东西一起喂进去,模型自己判断该干什么活。
一个模型,四种活
传统路线里,文本转语音是一套模型,语音编辑是另一套,增强和分离又是另外的。AuK 把这些合并成单一模型,用一致的输入表示来处理。
对开发者来说,这意味着不用再为每个任务单独接一套流程。开发流程简化了,灵活性也上来了。
轻量版快 4.5 倍
除了主模型,AuK 还给了一个轻量级版本,速度提升 4.5 倍。这个版本瞄准的是对响应速度敏感的场景:
- AI 语音助手
- 语音聊天机器人
- 实时配音服务
- 批量音效制作
实时应用最怕的就是等,4.5 倍的加速直接决定了这类场景能不能落地。
能用在哪些地方
按原文的说法,AuK 的适用范围覆盖虚拟助手、音频剪辑、广播制作,以及任何需要快速音频转换的场景。
配音、客服、AI 助手这几类需求,本质上都要求模型既能生成又能改,AuK 的统一路线正好对上。
该模型在多个任务中表现优秀,这是原文给出的评价。项目已开源,来源标注为 AIGCLINK。 |
|