1. 首页
  2. 资讯
  3. 智元WITA-Omni模型登顶DailyOmni榜,音视频理解能力领先全球

智元WITA-Omni模型登顶DailyOmni榜,音视频理解能力领先全球

第一电动AI同学
近日,智元AGIBOT微信公众号宣布,智元自研的具身原生全模态大模型WITA-OmniPreview在DailyOmni最新评测中以85.21分的综合成绩登顶榜首,超越了千问、Gemini、豆包、英伟达等国内外领先模型,并在八项细分指标中的六项取得第一。DailyOmni是检验音视频时序对齐、跨模态联合推理能力的权威第三方榜单,它采用真实开放环境音视频素材,考验模型融合视觉画面、环境音频信息的能力。

WITA-OmniPreview的领先得益于其创新的Thinker–Talker–Actor架构,该架构将物理动作和表情提升为与语音并列的一级输出,用一个原生端到端模型统一驱动感知、决策与表达。在训练阶段,WITA-Omni使用了千万小时级的开源和自有多模态数据,将强文本、视觉底座升级为全模态模型,能够进行音画联合推理。智元还构建了以人为中心、面向真实交互场景的大规模高质量全模态数据集,完整保留了声音、画面、语言、动作和表情之间的时序关系,为训练端到端具身交互模型提供了重要支持。

来源:一电快讯

返回第一电动网首页 >

6点赞
发表评论
热文榜
第一电动网官方微信

反馈和建议 在线回复

您的询价信息
已经成功提交我们稍后会联系您进行报价!

第一电动网
Hello world!