Alibaba Wan 2.7:思考モードがAI動画生成をどう変えるか
Alibabaが Wan 2.7をリリースしました。生成前に構図を計画する新しい思考モードを搭載しています。その仕組みとクリエイターへの影響を詳しく解説します。

思考モードとは
ほとんどの動画生成モデルはシングルパスで処理を行います。プロンプトを入力するとモデルがノイズをピクセルに拡散し、生成結果が出力されます。単純なシーンではこの方式で十分ですが、複数の被写体、特定の空間関係、複雑なアクションを含むプロンプトでは精度が大幅に低下します。
Wan 2.7は中間ステップを追加しました。ピクセルの生成を開始する前に、モデルは以下の処理を行います。
- プロンプトを解析し、意味的な構成要素(被写体、アクション、環境、照明)に分解する
- 構図を計画し、各要素の配置とインタラクション方法を決定する
- 出力を生成し、この計画を構造的なガイドとして使用する
これは「思考の連鎖(Chain-of-Thought)」推論が大規模言語モデルを改善した方法と類似しています。モデルに行動前の思考を強制することで、出力品質が劇的に向上します。特に複雑なプロンプトで顕著な効果が見られます。
Wan 2.7の完全なモデルスイート
Wan 2.7は単一のモデルではなく、異なる生成ワークフローをカバーする4つのモデルで構成されるスイートです。
| モデル | 入力 | 出力 | 最適な用途 |
|---|---|---|---|
| テキストから動画 | テキストプロンプト | 動画クリップ | ゼロからの制作 |
| 画像から動画 | 画像 + プロンプト | 動画クリップ | 静止画のアニメーション化、コンセプトアート |
| リファレンスから動画 | 参照動画 + プロンプト | 新しい動画 | スタイル転送、再制作 |
| 動画編集 | 動画 + 編集指示 | 修正済み動画 | ポストプロダクション、修正 |
テキストから動画モデルは4月3日からTogether AIで利用可能です。残りの3つのモデルは今後数週間で順次公開されます。
技術的詳細:アーキテクチャの解析
Alibabaはまだ完全な論文を公開していませんが、APIドキュメントと初期のベンチマークからいくつかの技術的詳細が明らかになっています。
| 判明している情報 | 独自の特徴 |
|---|---|
| 万象(Wanxiang)アーキテクチャ系譜に基づく | 明示的な構図計画を備えた初の本番モデル |
| 思考モードが拡散前に計画パスを追加 | マルチ要素シーンで5つ以上の被写体を適切に処理 |
| フレーム間の超リアルなキャラクター一貫性 | 生成動画内のテキストが判読可能(文字化けなし) |
| プロンプト条件付けによる精密な色彩制御 | 照明変化にわたって色彩精度が維持される |
| 優れた長文テキストレンダリング(動画内テキスト) | 複雑なカメラワークでも空間的な一貫性を維持 |
長文テキストのレンダリング能力は特に注目に値します。従来のモデルは動画フレーム内に判読可能なテキストを生成することが困難でした。Wan 2.7は看板、ラベル、さらには短い段落も驚くべき精度で処理できます。生成映像にテキストオーバーレイを組み込む必要があるクリエイターにとって、これは大きな前進です。
他モデルとのベンチマーク比較
今週、AI動画業界は大きく動きました。Wan 2.7のリリースと同時に、OpenAIがSoraの終了を確認し、GoogleはVeo 3.1の価格を大幅に引き下げました。
| モデル | 価格 | 音声 | 最大長 | キャラクター一貫性 | 思考/計画 |
|---|---|---|---|---|---|
| Wan 2.7 | $0.10/秒 | なし | 約10秒 | 強い | あり |
| Veo 3.1 Lite | $0.05/秒 | あり | 約8秒 | 良好 | なし |
| Veo 3.1 Fast | $0.12/秒 | あり | 約8秒 | 強い | なし |
| Kling 3.0 | 約$0.08-0.17/秒 | あり | 約10秒 | 強い | なし |
| Seedance 2.0 | バンドル | あり | 15秒 | 良好 | なし |
| Runway Gen-4.5 | 約$0.15/秒 | なし | 約10秒 | 強い | なし |
1秒あたり$0.10という価格設定により、Wan 2.7は競争力のある中価格帯に位置しています。Googleの低価格Liteオプションの2倍、Kling 3.0と同程度(プラットフォームにより変動)で、Runwayよりも大幅に安価です。
Wan 2.7を使うべき場面
初期テストとモデルの強みに基づき、Wan 2.7が最も効果を発揮するシナリオを紹介します。
複雑なマルチ被写体シーン
テキスト重視のコンテンツ
精密な色彩とスタイル制御
リファレンスによるスタイル転送
より単純な単一被写体のシーンで音声も必要な場合は、Kling 3.0やVeo 3.1の方が適している可能性があります。思考モードの計画オーバーヘッドは、プロンプトが複雑な場合にこそ真価を発揮します。
業界への影響
Wan 2.7の思考モードは、生成モデルの動作方法におけるより広範な変化を示唆しています。将来のモデルは、ノイズから力任せに出力を生成するのではなく、生成の各側面に明示的な計画段階を組み込むようになるでしょう。
このパターンは他の分野でもすでに見られます。コード生成モデルは記述前に計画を立て、画像モデルはレイアウト条件付けを使用し、そして今、動画モデルも「創作前に考える」ことを学んでいます。
競争圧力は確かに高まっています。Soraの撤退、Googleの値下げ、そしてWan 2.7やKling 3.0といった中国発モデルの品質向上により、クリエイターはかつてないほど多くの選択肢を手にしています。柔軟性を保つ理由もこれまで以上に大きくなっています。
各モデルの具体的なベンチマークでの比較については、Runway Gen-4.5のパフォーマンス分析をご覧ください。また、Seedance 2.0の展開がCapCutエコシステムをどのように変革しているかについても、先月詳しく取り上げています。

ローザンヌ出身のAIエンジニア。研究の深さと実践的なイノベーションを融合させています。モデルアーキテクチャとアルプスの山々の間で時間を過ごしています。
View profile →関連記事
これらの関連記事を引き続きお楽しみください

Alibaba HappyHorse-1.0: すべてのAI動画ランキングを制した謎のモデル
HappyHorse-1.0というモデルがArtificial Analysisに匿名で登場し、テキストから動画、画像から動画の両部門で1位を獲得。その正体はAlibabaでした。アーキテクチャ、開発チーム、そしてAI動画市場への影響をまとめます。

Sora 終了後の AI 動画市場:2026 年に知っておくべき 4 つの市場階層
Sora は 4 月 26 日に終了します。AI 動画市場は 4 つの階層に統合されました。ニーズに合った Sora の代替サービスを選ぶための実用的なガイドです。

Google Veo 3.1が無料開放: すべてのGoogleアカウントで月10本のAI動画生成が可能に
Googleが全個人アカウント向けにVeo 3.1を開放し, 月10回の無料動画生成を提供開始しました。具体的な内容, 制限事項, そしてAI動画クリエイターにとっての意味を解説します。