如何构建下一代语音模型

你对着语音助手说话,说到一半停下来想词,它插话了。或者你问了个要查资料的问题,它"嗯……",然后是五秒空白。
这两件事——爱插话、爱冷场——是过去所有语音助手的通病。它们看起来是两个毛病,其实是同一个结构问题。
语音一直是别的东西的转接头
第一代的做法是接力:说话转成文字,文字交给模型想,想完的文字再合成回声音。三个模型串起来。这条路第一次让人能"对着"前沿模型说话,代价也写在结构里——语气、犹豫、抢话,进了文字那一层就全没了;而且每一棒都要交接时间,所以慢,而且生硬。
第二代把三棒并成一个模型,直接吃音频、吐音频。快了不少,也顺了。但它还是一句一句轮着来的:得先确认你"说完了"才开口。怎么确认?听你有没有停下来。于是你想词的那两秒停顿,和你真的说完了的那两秒停顿,在它眼里一模一样。
两代人都在优化同一条路上的速度。但问题从来不在速度。
第一件想清楚的事:人不是轮流说话的
真实对话里几乎所有让人觉得自然的部分,都发生在重叠的时候。你说着,我"嗯嗯";我听出你要收尾,提前接上;你说错了,我立刻打断你。
这些都不是"更快的轮流"。在一条单车道上,你把每一段都优化到极致,也拼不出重叠——因为重叠根本不在那条路上。
所以第一个决定是:输入和输出必须同时跑。听的时候能说,说的时候能听。模型不再是"收到一段、回一段",而是持续地在听、也持续地在决定:现在该说,还是继续听,还是停一下,还是打断,还是去调用一个工具。
这不是性能优化,是换一种时间结构。
第二件想清楚的事:说话和思考不该抢同一个脑子
这一件更关键。
上一代的死结在于,语音模型自己就是那个"聪明"。你问一个需要查、需要好好想的问题,它只能停下对话去查、去想。于是想得越深,对话越僵——你被迫在"聪明"和"自然"之间二选一。
拆开,这个矛盾就不存在了。前台一个负责说话,后台一个负责干活。碰上需要查资料、需要真想一想的问题,前台把活扔给后台,自己继续跟你聊;结果回来了,再自然地接进对话里。
一旦这么拆,三件事同时成立:
- 天花板不再是语音模型了。 后台换成更强的模型,整个体验跟着变强,前台一行都不用动。
- "想多久"变成一个能调的旋钮,而不是一次体验降级。 深度调在后台那一侧,不动前台的对话结构。
- 前台可以专心做好一件事:把对话接住。
我们认为这才是"下一代"真正的分界线。不是音色更像人,也不是延迟又降了几十毫秒,而是:对话的连续,和思考的深度,不再互相收费。
想清楚这两件事之后,很多设计是自己长出来的
我们的框架说白了就是三条同时在跑的线:你、一个负责说话的、一个负责干活的。中间有一层负责调度——谁该开口、谁该闭嘴、哪句话可以出口。
有意思的地方在于,一旦接受了上面那两个前提,剩下的许多决定几乎不需要再讨论:
等待不能是沉默。 后台干活的那几秒,前台必须还在。哪怕只是一句"我看一下",也比一段空白强得多——空白会让人以为它死了。
打断是主线,不是异常处理。 用户随时可以插话,这不是需要兜底的边缘情况,这就是系统正常运转的样子。顺带一个很隐蔽的坑:被打断之后,那个已经没人要的答案必须彻底作废。最让人出戏的从来不是"它没刹住",而是半分钟后,它突然把你早就打断掉的那件事说了出来。
不给自己留退路。 实时那条路不通的时候,退回上一代(转文字、想、再合成)是最省事的选择。我们决定不留这条路。因为退路一旦存在就会变成常态——它更便宜、更好接、而且在演示里根本看不出来。做不到就重连,或者老实说这次不行,不假装还在工作。
安全上,有一半的事只能实时做。 后台给出的结论,在说出口之前可以先审一遍;但前台自己随口说的那些"嗯"、"我看看",任何实时语音系统都没法逐字预审——只能一边说一边听着,不对劲就纠,再不对就结束这通对话。这两条得分开讲,混在一起就成了一句做不到的承诺。
怎么知道做对了
不用看参数,也不用看演示——演示里所有系统都很自然。戴上耳机聊十分钟,注意四件事就够了:
它说话的时候,你能不能插进去;你插完之后,那个被丢掉的答案会不会自己冒出来;你问一个必须联网的问题,接下来那几秒是不是还有人在跟你说话;以及出问题的时候,它是明说,还是悄悄退回上一代,然后装作无事发生。
接下来:Interaction Live
上面这套东西,我们不是拿来写文章的。
Lumirain 做的是 AI 同事——交付成果,不交付过程。但到今天为止,你和它之间还隔着一层:你得把一个还没想清楚的念头,先组织成完整的一段文字,才能开始。
语音本该是那层隔阂消失的地方。它不占你的手,也不要求你先想周全。而只有当"说话"和"思考"不再互相拖着,语音才配得上真正的工作,而不只是问天气、设闹钟。
Interaction Live 就是这件事:让你用说的,和你的 AI 同事无缝沟通。你说到一半改主意,它跟得上;它在后台查资料、动手干活的时候,你们的对话不用停;活干完了,它顺着当前的话头把结果告诉你——而不是让你盯着一个转圈的图标等。
这不是给产品加一个语音输入框。这是把上面那三条车道,真正接到一个会替你干活的 AI 同事身上。
我们不宣称的事
写研究就要把边界写在正文里,而不是脚注里。
本文讲的是设计思路,不是性能报告。全文没有一个我们自己的基准数字——Interaction Live 还没有交付,没测过的数我们不写。等它上线,我们会用一份可以较真的说明来交代它到底做到了什么、没做到什么。
在那之前,这篇只代表我们对这件事的判断。
