医院场景实测豆包!视频能力助攻特殊人群看病全流程太贴心

医院场景实测豆包!视频能力助攻特殊人群看病全流程太贴心

你有没有同感?跟 AI 认真聊两句,怎么听怎么别扭。

尤其是开语音通话的时候,AI 和真人的界限简直一目了然。

说白了,当下的 AI 语音交互,还像是在打回合制 RPG。你出招它挨打,它出招你干瞪眼。

没法自然地插话或停顿,它也搞不清你是对着它说,还是跟旁边人闲聊。

这种交互上的硬伤,直接把 AI 锁死在“答题机”和“代码助手”的框框里。

上个月,OpenAI 发了 GPT-Live,主打说话时能持续接收输入,外界评价还行。

但很多人不以为然:这有啥新鲜的?今年 4 月,豆包的语音通话就已经上线这功能了。

前两天,豆包又放大招,升级视频通话能力,接入了原生音视频多模态全双工大模型 SeedRealtime。官方说法是,能提升音视频理解力,增强抗干扰和打断判停表现。

所谓的全模态全双工,核心就一件事:针对前面提到的那些拧巴点——特别是回合制对话模式,来个大改版。

听着挺诱人,我们立马找了几个真实场景实测。

技术再牛,咱们更在乎实不实用。用起来顺不顺心?遇到急事能不能顶用?

先测基础款,看看新版豆包视频电话,是不是还在玩回合制。

别说,现在的豆包确实灵光了。以前的版本像个单线程生物,耳朵嘴巴只能用一个。它一开口,你就别想下指令;它一听,脑子就停转。

现在的豆包就不一样了,哪怕它正叭叭个不停,只要捕捉到你的声音,立马闭嘴,还会根据你的新提问调整回答。

从测试视频也能看出,它对人类提问和断句的判断准多了。

以前你可能只是卡壳一下,话没说完,它就自顾自地开始答。现在,它能分清你是不是还没说完,聊天体验更像面对面跟个小姐姐唠嗑。

不仅如此,豆姐的抗干扰能力也强了不少。

以前它像长了顺风耳,旁边有点动静,就容易误判是你的新指令,转头去回应杂音。现在,它像是有了声纹识别,基本做到和你一对一私聊。

我们还发现,豆包视频的识别速度相当快。

比如下面这个视频,我们玩游戏让它帮忙选武将。就我们那手速,豆包识别得又快又准。

测试中还发现,即便编辑部有人在前头打游戏,后面坐着一群“狗头军师”出主意。

豆包也能 hold 住这种多人混战的复杂场景。它随时在线听大家说话,清楚分辨谁在说、说了啥。

就连沉浸操作的同事小声嘀咕一句“怎么冲刺”,都被豆包精准捕捉,顺手打了个“不太会玩”的标签。

接着给豆包上强度。刚好编辑部在装测试平台,我们让豆包当装机高手,指导操作。

豆包只需简单扫一眼,就知道进度如何。

更有趣的是,除了指导步骤,误操作时它还会主动提醒。

豆包甚至很有眼力见,实时盯着我的手部动作。装内存条时,提前提醒注意正反面,千万别用蛮力硬怼。

而且,豆包能全流程跟踪大型任务。当我们按指导装完显卡,以为大功告成准备收工时。

这哥们儿居然查漏补缺:“喂,显卡供电线还没接呢!”

连角落里最容易被忽略的主板 CPU 供电线,都没逃过它的眼睛。主打一个:你随便折腾,我来兜底。

过程中,我们还见识了豆包强大的记忆功能。

全程开着视频,装完平台准备离开影棚时,想起有台测试机不知放哪了。

我突然想,豆包会不会知道?结果还真记着呢。

这不只是听懂话,简直是 AI 吃了哆啦 A 梦的记忆面包。

平时跟真人打电话,谁会帮你记随手搁哪的东西?豆包偏偏就盯住了。

如果说装机只是影棚里的极客游戏,在人声鼎沸、流程复杂的医院里,豆包还能扛得住吗?

我们把豆包带到了医院,想试试更新后的视频能力,能否辅助老人等特殊人群独自看病。

刚到门口,两眼一抹黑,问豆包去哪取号。

豆包提示:面前的自助机或人工窗口都行。

它还贴心建议:如果提前预约好,人工窗口排队人多,选自助更方便。

按引导取好号后,常见问题是找不到诊室。大医院容易把人绕晕,但现在,拍张照给豆包看,它会告诉你怎么走。

到了诊室门口,很多医院要先签到才能进排队队列。不同医院、科室的规则和设备各异,常让人懵圈。豆包却能一眼看清怎么操作。

整套测试下来,从进门取号、找电梯到楼层、签到……除了路过护士和路人用奇怪眼光打量世超外,几乎挑不出毛病。

在取号、找路、识设备这些流程性任务上,豆包已能提供全程陪同。

总体看,豆包视频能力提升明显。但我们觉得,最有意思的不是它多认了几个东西或反应多快,而是它开始尝试理解语气、声音,真正学会了像人一样沟通。

我们研究了一下,为啥进步这么快。功臣是底层的 SeedRealtime。

以前的 AI 视频通话本质是流水线:

听声音→转文字→看截图→综合处理→生成语音。

这种串联思路,每一步再快,连起来也慢半拍。

SeedRealtime 狠就狠在,把声音、画面、时序与表达融进了一个端到端模型。

看听说在同一系统内并行,不分先后。AI 能通过手势和画面,秒懂你说的“这个、那个”指啥,也能精准过滤旁人杂音。

同样,能持续理解视频场景变化,AI 才分得清何时闭嘴、何时主动提醒。

最终呈现的效果,就是懂得察言观色,像个真人。

理清底层逻辑后你会发现,豆包这次展示的能力,正是整个 AI 行业死磕的方向之一。

隔壁海外大厂也在推实时语音、多模态交互和思考模型。除了前面提过的 GPT-Live,OpenAI 还展示了 Thinking Machines,但功能尚处演示阶段,公众没法随意使用。

所以,豆包的音视频全双工能力,才是真正向贾维斯方向进化的关键一步。

当然,离贾维斯还有距离。现在还得举着手机,视频通话也受网络、续航限制。

但至少从这次体验看,AI 助手正从“你问它答”,变成边看、边听、边协助的角色。

多说两句,手机形态似乎制约了未来 AI 的发展。如果视频能力跳出手机,应用到智能眼镜、手环或其他 AI 硬件上(当然,得解决续航、散热、网络、算力等问题),或许能开启一个全新的原生 AI 世界。

不久的将来,要是看到有人在街上嘀嘀咕咕,别以为人家魔怔了,说不定他正在跟豆包视频通话呢。

撰文:八戒

编辑:江江 & 面线

美编:焕妍

图片、资料来源:

豆包