按 Enter 搜索 · ESC 关闭

AI × Crypto

阿里通义千问发布Qwen3.8-Omni-Flash全模态模型

阿里通义千问9月18日发布首个围绕智能体能力打造的全模态模型Qwen3.8-Omni-Flash,将原生音视频理解、推理及工具调用整合至单一模型,可完成理解内容、规划任务、调用工具并交付结果的完整流程。该模型支持100万token上下文,可在长视频中主动定位关键片段。在OmniVideoBench测试中,其智能体感知模式较静态理解减少51.8%的token消耗,视频输入成本较Qwen3.5-Omni-Plus下降约89%。

原文

AI 解读

这次发布的重点不在“全模态”本身,而在于把智能体能力做成了原生架构:感知、推理、调用工具被压进同一个模型,意味着多模态不再是先看懂再交给下游智能体,而是边看边决策。成本下降与token消耗减少指向的是长视频场景的商业可行性,这会直接影响做视频理解、内容审核与自动化工作流的开发者选型。接下来值得观察的是,这种智能体式感知能否在真实长视频任务中稳定复现,以及工具调用的可靠性是否跟得上成本优势。

由 AI 生成,仅供参考。

分享本文

相关快讯

TREE NEWS 分享卡片
长按上方图片 → 保存到相册 / 转发分享
寻求报道 加入社群 意见反馈