AlibabaのQwen3.8-Omni-Flash、音声・動画編集をエージェントが自律遂行
Alibaba releases Qwen 3.8 Omni Flash
Alibabaが次世代ネイティブ全モーダルモデルQwen3.8-Omni-Flashを公開。テキスト・画像・音声・動画を扱う100万トークンのコンテキスト窓を持ち、動画編集やMV制作、映画解説、リアルタイム会話などのワークフローをエージェントが計画・ツール呼び出し・実行まで完結させる。音声入力のAPI価格は前世代比98%以上減、長時間動画理解ではトークン消費を約45.7%削減しつつ精度を向上。音声・視覚性能はGemini 3.8 Flashに匹敵、音声総合では上回る。
Qwen2.5-Omni-3Bの文字誤り率は最終的に25.79%から15.30%へと低下し、相対的に約40.7%の削減となった。
HNでの議論
117- mavamaarten
最近思うんだけど、この大量のモデルの中からモデルを選ぶのを手伝ってくれるツールとかってないのかな?何かにモデルが必要になるたびにopenrouterのリストを見るんだけど、完全に圧倒されちゃうんだよね。
自分のユースケースとコストの好みを説明したら、試すべき良いモデルをいくつか選んでくれるツールがあったらいいのに。
例えば、迷惑メールボックスを掃除するツールを書いたとする。すでにスパムとフラグが立っているメールを分類して、明らかにスパムなら永久に削除する(ただしディスクにはコピーを残す)。で、x通のメールがたまったら、削除したスパムメールのリストを見てメールルールを提案する。これに最適なモデルはどれ?こういうユースケースを説明して、その情報を出してほしいんだよね。モデルのリストと、それぞれ何が得意かの情報がバラバラすぎて散らばりすぎてる。今のところgoogle/gemma-4-31bに落ち着いてる。安いし十分だし、オランダ語とフランス語も少しはサポートしてるから。でも現実的に全部は試せないよ。
- _ache_
性能が同程度で、そうでない証拠もないなら。
in/out ($) Gemini : 1.5 / 9.0 | Qwen 3.8: 0.15 / 0.47
これは大幅なコスト削減だ。
参考:
https://www.alibabacloud.com/help/en/model-studio/model-pric...
- syntaxing
> 音声視覚性能はGemini 3.8 Flashに近く、総合的な音声性能はGemini 3.8 Flashを上回る
本当ならすごいな。Geminiの音声能力と多言語対応は多くの人にとって「売り」だったと思う。他の能力も3.8 Flashと同等か上回っている。
新しいハーネスも作ったみたいだけど、githubのリンクは404みたいだ。
- conception
3.8 Maxは最も「地に足のついた」モデルだと思う。普通に話すし、暴走して勝手に何かを始めたりしない(Gemini、お前のことだぞ)、デザインの選択も良くて、過度に細かくもない。でもとにかく遅い。しかもAlibabaからしか使えない。トークンのプランもケチだし。あえて「昔ながらの信頼できる退屈な」LLM、言うなれば現代のClaude 4.5を選ぶなら、Qwenが僕の選択だ。RLで駄目にされなければいいけど。
- podocarp
お願いだからflash pro ultraとかこういうのが何なのか教えてほしい、semverとか使ってくれないかな
- esquire_900
ブログ記事自体は技術的に大したことなくて、スロップな未来って感じがする。いろいろあるけど
- Firefoxでのスクロールは悪夢(uBlock originしか入れてない)し、コンソールは警告とデバッグデータでいっぱい。
- 動画はどれも派手だけど、小さな段落で言える以上のことを伝えられていない(しかもひどいストック音楽付き)。
- 図1、ヘッドピース。小さすぎて読めないし、ズームもできない
- tolugenius
Qwen4シリーズがいつ出るのか、出るのか気になる。Qwenの好きなところの一つは、サイズのラインナップがずっと広いから、極小のLLMをいろいろ試せることだ。
- lxe
ハーネスのリポジトリはもう削除されたみたいだね?