Meta Pixelメインコンテンツへスキップ
AlexisAlexis· AI著、専門家がレビュー済み
11 min read
274

Alibaba Wan 2.7:思考モードがAI動画生成をどう変えるか

Alibabaが Wan 2.7をリリースしました。生成前に構図を計画する新しい思考モードを搭載しています。その仕組みとクリエイターへの影響を詳しく解説します。

Alibaba Wan 2.7:思考モードがAI動画生成をどう変えるか

自分だけのAI動画を作る準備はできましたか?

Bonega.aiを利用する数千人のクリエイターに参加しましょう

Alibabaの通義研究所は2026年4月6日にWan 2.7をリリースし、AIビデオモデルのプロンプト処理を根本から変える「思考モード」を導入しました。テキストから直接フレームを生成するのではなく、モデルがまずシーンの内部計画を構築し、それに基づいて生成を実行します。その結果は明白です。アーティファクトの減少、一貫性の向上、そして明らかに意図的な構図が実現されています。

思考モードとは

ほとんどの動画生成モデルはシングルパスで処理を行います。プロンプトを入力するとモデルがノイズをピクセルに拡散し、生成結果が出力されます。単純なシーンではこの方式で十分ですが、複数の被写体、特定の空間関係、複雑なアクションを含むプロンプトでは精度が大幅に低下します。

Wan 2.7は中間ステップを追加しました。ピクセルの生成を開始する前に、モデルは以下の処理を行います。

  1. プロンプトを解析し、意味的な構成要素(被写体、アクション、環境、照明)に分解する
  2. 構図を計画し、各要素の配置とインタラクション方法を決定する
  3. 出力を生成し、この計画を構造的なガイドとして使用する
💡
即興で絵を描くのと、まず構図のスケッチを行ってから描くのとの違いに似ています。スケッチは最終作品には現れませんが、すべての筆遣いに影響を与えます。

これは「思考の連鎖(Chain-of-Thought)」推論が大規模言語モデルを改善した方法と類似しています。モデルに行動前の思考を強制することで、出力品質が劇的に向上します。特に複雑なプロンプトで顕著な効果が見られます。

Wan 2.7の完全なモデルスイート

Wan 2.7は単一のモデルではなく、異なる生成ワークフローをカバーする4つのモデルで構成されるスイートです。

4
モデルスイート
$0.10/秒
API価格
4月6日
リリース日
モデル入力出力最適な用途
テキストから動画テキストプロンプト動画クリップゼロからの制作
画像から動画画像 + プロンプト動画クリップ静止画のアニメーション化、コンセプトアート
リファレンスから動画参照動画 + プロンプト新しい動画スタイル転送、再制作
動画編集動画 + 編集指示修正済み動画ポストプロダクション、修正

テキストから動画モデルは4月3日からTogether AIで利用可能です。残りの3つのモデルは今後数週間で順次公開されます。

技術的詳細:アーキテクチャの解析

Alibabaはまだ完全な論文を公開していませんが、APIドキュメントと初期のベンチマークからいくつかの技術的詳細が明らかになっています。

判明している情報独自の特徴
万象(Wanxiang)アーキテクチャ系譜に基づく明示的な構図計画を備えた初の本番モデル
思考モードが拡散前に計画パスを追加マルチ要素シーンで5つ以上の被写体を適切に処理
フレーム間の超リアルなキャラクター一貫性生成動画内のテキストが判読可能(文字化けなし)
プロンプト条件付けによる精密な色彩制御照明変化にわたって色彩精度が維持される
優れた長文テキストレンダリング(動画内テキスト)複雑なカメラワークでも空間的な一貫性を維持

長文テキストのレンダリング能力は特に注目に値します。従来のモデルは動画フレーム内に判読可能なテキストを生成することが困難でした。Wan 2.7は看板、ラベル、さらには短い段落も驚くべき精度で処理できます。生成映像にテキストオーバーレイを組み込む必要があるクリエイターにとって、これは大きな前進です。

他モデルとのベンチマーク比較

今週、AI動画業界は大きく動きました。Wan 2.7のリリースと同時に、OpenAIがSoraの終了を確認し、GoogleはVeo 3.1の価格を大幅に引き下げました。

モデル価格音声最大長キャラクター一貫性思考/計画
Wan 2.7$0.10/秒なし約10秒強いあり
Veo 3.1 Lite$0.05/秒あり約8秒良好なし
Veo 3.1 Fast$0.12/秒あり約8秒強いなし
Kling 3.0約$0.08-0.17/秒あり約10秒強いなし
Seedance 2.0バンドルあり15秒良好なし
Runway Gen-4.5約$0.15/秒なし約10秒強いなし
⚠️
Wan 2.7にはネイティブの音声生成機能がありません。同期した音声が必要なプロジェクトでは、別途音声パイプラインを用意するか、Kling 3.0やVeo 3.1のようにネイティブで音声を生成できるモデルを使用する必要があります。

1秒あたり$0.10という価格設定により、Wan 2.7は競争力のある中価格帯に位置しています。Googleの低価格Liteオプションの2倍、Kling 3.0と同程度(プラットフォームにより変動)で、Runwayよりも大幅に安価です。

Wan 2.7を使うべき場面

初期テストとモデルの強みに基づき、Wan 2.7が最も効果を発揮するシナリオを紹介します。

🎬

複雑なマルチ被写体シーン

プロンプトに複数のキャラクターやオブジェクトのインタラクションが含まれる場合、思考モードは優れた結果を発揮します。計画ステップにより、他のモデルで頻発する空間的な混乱を防止できます。
📝

テキスト重視のコンテンツ

動画に判読可能なテキスト、看板、UI要素が必要な場合、Wan 2.7のテキストレンダリングは現時点で最高水準です。
🎨

精密な色彩とスタイル制御

色彩条件付けシステムにより、正確なカラーパレットを指定し、フレーム間で一貫性を保つことができます。ブランドイメージの統一に最適です。
🔄

リファレンスによるスタイル転送

近日公開予定のリファレンスから動画モデルにより、既存のクリップをスタイルガイドとして入力し、そのビジュアル言語に一致する新しいコンテンツを生成できます。

より単純な単一被写体のシーンで音声も必要な場合は、Kling 3.0やVeo 3.1の方が適している可能性があります。思考モードの計画オーバーヘッドは、プロンプトが複雑な場合にこそ真価を発揮します。

業界への影響

Wan 2.7の思考モードは、生成モデルの動作方法におけるより広範な変化を示唆しています。将来のモデルは、ノイズから力任せに出力を生成するのではなく、生成の各側面に明示的な計画段階を組み込むようになるでしょう。

このパターンは他の分野でもすでに見られます。コード生成モデルは記述前に計画を立て、画像モデルはレイアウト条件付けを使用し、そして今、動画モデルも「創作前に考える」ことを学んでいます。

💡
2026年はモデルのリリースペースが非常に速く、特定のベンダーに依存するのはリスクを伴います。パイプラインベースのアプローチを採用し、より優れたモデルが登場した際に生成バックエンドを柔軟に切り替えられるようにすることで、ベンダーロックインからワークフローを守ることができます。

競争圧力は確かに高まっています。Soraの撤退、Googleの値下げ、そしてWan 2.7やKling 3.0といった中国発モデルの品質向上により、クリエイターはかつてないほど多くの選択肢を手にしています。柔軟性を保つ理由もこれまで以上に大きくなっています。

各モデルの具体的なベンチマークでの比較については、Runway Gen-4.5のパフォーマンス分析をご覧ください。また、Seedance 2.0の展開がCapCutエコシステムをどのように変革しているかについても、先月詳しく取り上げています。

Alexis
AlexisAI EngineerAI Author

ローザンヌ出身のAIエンジニア。研究の深さと実践的なイノベーションを融合させています。モデルアーキテクチャとアルプスの山々の間で時間を過ごしています。

View profile →

記事を気に入っていただけましたか?

アイデアを数分で長さ無制限のAI動画に変えましょう。

関連記事

これらの関連記事を引き続きお楽しみください

この記事はいかがでしたか?

さらに多くのインサイトを発見し、最新コンテンツをチェックしましょう。