星期三
/
2026-07-29
Beijing,cn
94 °F
broken clouds
broken clouds
Search
Close this search box

科技正在以前所未有的速度重构我们的生活,但信息越密集,真相越模糊。
深维让每一篇文章,都是一次从“dim(朦胧)”到“deep(深彻)”的探索。

在深维,看清科技的全貌。

社交媒体

Home » 今日快讯 » 智元WITA-Omni Preview登顶DailyOmni全模态理解榜单,超越Gemini、豆包

智元WITA-Omni Preview登顶DailyOmni全模态理解榜单,超越Gemini、豆包

  新浪科技讯 7月28日下午消息,近日,具身全模态理解权威榜单DailyOmni最新评测结果揭晓,智元自研的具身原生全模态大模型WITA-Omni Preview以85.21分综合成绩登顶榜首,超过千问、Gemini、豆包、英伟达等国内外领先模型,并在八项细分指标中的六项取得第一。

  DailyOmni是行业公认的检验音视频时序对齐、跨模态联合推理能力的权威第三方榜单。该榜单大量采用真实开放环境音视频素材,核心考验模型融合视觉画面、环境音频信息,精准识别声画对应关系、事件先后顺序及跨模态语义的综合能力,高度贴合人形机器人在真实物理空间开展人机交互所需的核心感知能力。

  据悉,WITA-Omni领先的关键,在于它并不是简单地把聊天模型“装进”机器人,而是将物理动作和表情提升为与语音并列的一级输出,用一个原生端到端模型统一驱动感知、决策与表达,从Thinker–Talker范式上进一步扩展出面向具身输出的 Thinker–Talker–Actor 架构。

  在中训练阶段,WITA-Omni使用千万小时级多模态数据,将强文本、视觉底座进一步升级为能够“听得见、看得懂,并进行音画联合推理”的全模态模型。

声明:

      文章转载自网络,版权归原作者;内容为作者独立观点,不代表 DimDeep 立场。​若有版权异议,请联系我们处理,转载请联系原作者。

Leave a Reply

您的邮箱地址不会被公开。 必填项已用 * 标注

0

SHARE

动态跟踪

Email

点击提交按钮,即表示您确认已阅读并同意我们不定期向您的邮箱发送最新资讯。

关注我们

© 2026 深维科技 北京兴拓互动科技有限公司 版权所有  京ICP备2022029399号-4