Alibaba 发布 Qwen3.8-Omni-Flash,多模态 Agent 进化
Alibaba releases Qwen 3.8 Omni Flash
Alibaba 正式推出 Qwen3.8-Omni-Flash,这款原生多模态模型将 Agent 能力从单纯的内容理解推向了任务规划与执行的新高度。它支持 1M 级上下文窗口,能独立处理视频剪辑、音乐 MV 制作及长会议记录等复杂工作流。模型在长视频理解中采用“主动搜索”策略,精准定位关键信息,Token 消耗降低约 46%。更令人惊喜的是,它不仅能优化自身,还能自主完成 Qwen2.5-Omni-3B 方言模型的微调任务,将字错率大幅降低。从感知到行动,Qwen3.8-Omni-Flash 正在重新定义音频和视频在生产力场景中的核心地位。
音频和视频正从单纯的感知输入,演变为 Agent 理解环境、进行推理并执行任务的核心媒介。
HN 评论区
102- mavamaarten
我有点好奇,现在市面上有没有什么工具能帮我在如今这海量的模型里挑出合适的?每次我需要找个模型时,看到 OpenRouter 上的列表就完全被淹没了。
我希望能有个工具,让我描述一下使用场景和成本偏好,然后它帮我推荐几个值得尝试的好模型。
举个例子:我写了一个工具来清理邮箱垃圾邮件。它会分类那些已经被标记为垃圾的邮件,如果确认是明显的垃圾邮件,就永久删除(不过会在磁盘上保留一份副本)。处理完 x 封邮件后,它会遍历已删除的垃圾邮件列表,并建议设置邮件规则。哪种模型最适合这个场景?我希望能描述这个用例,然后直接得到推荐信息。目前的模型列表和它们各自擅长领域的信息太零散、太分散了。我暂时选用了 google/gemma-4-31b,因为它便宜、够用,而且还能勉强支持一点荷兰语和法语。但我不可能把所有模型都试一遍。
- _ache_
如果性能相当的话(目前也没有证据表明不相当):
输入/输出(美元):Gemini 是 1.5 / 9.0 | Qwen 3.8 是 0.15 / 0.47
这成本降低得太惊人了。
参考:
https://www.alibabacloud.com/help/en/model-studio/model-pric...
- syntaxing
> 音视频性能接近 Gemini 3.8 Flash,整体音频性能甚至超越 Gemini 3.8 Flash
如果属实,这太疯狂了。我觉得 Gemini 的音频能力和多语言支持一直是很多人的“卖点”。其他能力也匹配甚至超越了 3.8 Flash。
他们还搞了个新的测试框架(harness),但 GitHub 链接似乎 404 了。
- conception
我觉得 3.8 Max 是最“脚踏实地”的模型——说话一般都很正常,不会发疯乱搞(Gemini 你懂的),设计选择合理,也不会过分纠结细节。但老天,它太慢了。而且只能通过阿里云获取。他们的 Token 套餐也太抠门了。如果非要选一个“老可靠、无聊但稳重”的 LLM,就像现代的 Claude 4.5 那样,我会选 Qwen。希望他们别用 RL 把它调教到面目全非。
- podocarp
请问 flash pro ultra 这些是什么?他们能不能直接用语义化版本(semver)之类的?
- esquire_900
这篇博文本身技术上没什么亮点,感觉像是那种“垃圾内容未来”的产物。其中很多问题包括:
- 在 Firefox 里滚动简直是噩梦(只有 uBlock Origin 能救),控制台里全是警告和调试数据。
- 视频全都很花哨,但除了能用一小段话说明的内容外,什么都传达不出来(还配了难听的库存音乐)。
- 图 1 的头饰部分太小,看不清,还无法放大。
- tolugenius
好奇什么时候能看到 Qwen4 系列?我喜欢 Qwen 的一点是它提供了更大范围的尺寸选择,这样我就能实验那些极小的 LLM 了。
- lxe
看起来那个 harness 仓库已经被删了?