TREE NEWS 消息, 阿里通义千问9月18日发布首个围绕智能体能力打造的全模态模型Qwen3.8-Omni-Flash,将原生音视频理解、推理及工具调用整合至单一模型,可完成理解内容、规划任务、调用工具并交付结果的完整流程。该模型支持100万token上下文,可在长视频中主动定位关键片段。在OmniVideoBench测试中,其智能体感知模式较静态理解减少51.8%的token消耗,视频输入成本较Qwen3.5-Omni-Plus下降约89%。
阿里通义千问发布Qwen3.8-Omni-Flash全模态模型
AI 解读
这次发布的重点不在“全模态”本身,而在于把智能体能力做成了原生架构:感知、推理、调用工具被压进同一个模型,意味着多模态不再是先看懂再交给下游智能体,而是边看边决策。成本下降与token消耗减少指向的是长视频场景的商业可行性,这会直接影响做视频理解、内容审核与自动化工作流的开发者选型。接下来值得观察的是,这种智能体式感知能否在真实长视频任务中稳定复现,以及工具调用的可靠性是否跟得上成本优势。
由 AI 生成,仅供参考。