AlibabaのQwen3.8-Omni-Flash、音声・動画編集をエージェントが自律遂行

Alibaba releases Qwen 3.8 Omni Flash

Alibabaが次世代ネイティブ全モーダルモデルQwen3.8-Omni-Flashを公開。テキスト・画像・音声・動画を扱う100万トークンのコンテキスト窓を持ち、動画編集やMV制作、映画解説、リアルタイム会話などのワークフローをエージェントが計画・ツール呼び出し・実行まで完結させる。音声入力のAPI価格は前世代比98%以上減、長時間動画理解ではトークン消費を約45.7%削減しつつ精度を向上。音声・視覚性能はGemini 3.8 Flashに匹敵、音声総合では上回る。

Qwen2.5-Omni-3Bの文字誤り率は最終的に25.79%から15.30%へと低下し、相対的に約40.7%の削減となった。
  1. mavamaarten

    最近思うんだけど、この大量のモデルの中からモデルを選ぶのを手伝ってくれるツールとかってないのかな?何かにモデルが必要になるたびにopenrouterのリストを見るんだけど、完全に圧倒されちゃうんだよね。

    自分のユースケースとコストの好みを説明したら、試すべき良いモデルをいくつか選んでくれるツールがあったらいいのに。

    例えば、迷惑メールボックスを掃除するツールを書いたとする。すでにスパムとフラグが立っているメールを分類して、明らかにスパムなら永久に削除する(ただしディスクにはコピーを残す)。で、x通のメールがたまったら、削除したスパムメールのリストを見てメールルールを提案する。これに最適なモデルはどれ?こういうユースケースを説明して、その情報を出してほしいんだよね。モデルのリストと、それぞれ何が得意かの情報がバラバラすぎて散らばりすぎてる。今のところgoogle/gemma-4-31bに落ち着いてる。安いし十分だし、オランダ語とフランス語も少しはサポートしてるから。でも現実的に全部は試せないよ。

  2. _ache_

    性能が同程度で、そうでない証拠もないなら。

    in/out ($) Gemini : 1.5 / 9.0 | Qwen 3.8: 0.15 / 0.47

    これは大幅なコスト削減だ。

    参考:

    https://www.alibabacloud.com/help/en/model-studio/model-pric...

    https://runware.ai/gemini-omni

  3. syntaxing

    > 音声視覚性能はGemini 3.8 Flashに近く、総合的な音声性能はGemini 3.8 Flashを上回る

    本当ならすごいな。Geminiの音声能力と多言語対応は多くの人にとって「売り」だったと思う。他の能力も3.8 Flashと同等か上回っている。

    新しいハーネスも作ったみたいだけど、githubのリンクは404みたいだ。

  4. conception

    3.8 Maxは最も「地に足のついた」モデルだと思う。普通に話すし、暴走して勝手に何かを始めたりしない(Gemini、お前のことだぞ)、デザインの選択も良くて、過度に細かくもない。でもとにかく遅い。しかもAlibabaからしか使えない。トークンのプランもケチだし。あえて「昔ながらの信頼できる退屈な」LLM、言うなれば現代のClaude 4.5を選ぶなら、Qwenが僕の選択だ。RLで駄目にされなければいいけど。

  5. podocarp

    お願いだからflash pro ultraとかこういうのが何なのか教えてほしい、semverとか使ってくれないかな

  6. esquire_900

    ブログ記事自体は技術的に大したことなくて、スロップな未来って感じがする。いろいろあるけど

    - Firefoxでのスクロールは悪夢(uBlock originしか入れてない)し、コンソールは警告とデバッグデータでいっぱい。

    - 動画はどれも派手だけど、小さな段落で言える以上のことを伝えられていない(しかもひどいストック音楽付き)。

    - 図1、ヘッドピース。小さすぎて読めないし、ズームもできない

  7. tolugenius

    Qwen4シリーズがいつ出るのか、出るのか気になる。Qwenの好きなところの一つは、サイズのラインナップがずっと広いから、極小のLLMをいろいろ試せることだ。

  8. lxe

    ハーネスのリポジトリはもう削除されたみたいだね?

この日のほかの記事

2026-09-18