Luma Agents とエージェント型ビデオ編集の台頭、AI が導演を学ぶ
Luma はテキスト、画像、ビデオ、オーディオを調整する創造的 AI エージェントを立ち上げたばかりです。a16z がこのテーゼを支持している背景で、エージェント型ビデオ編集はテキスト生成ビデオ以来最大の転換です。

誰も解決していない 80/20 の問題
ここに、ビデオを制作している誰もが気になるべき統計があります。製作時間の 80% は編集に、20% は実際の撮影に費やされます。今我々が持っているすべての AI ツールにもかかわらず、この比率は 10 年間ほとんど変わっていません。
考えてみてください。テキストプロンプトから 1 分以内にリアルな 4K ビデオクリップを生成できます。声を複製し、顔を交換し、シーンを拡張できます。しかし、これらすべてをまとめて一貫した見られるビデオにすること?それは依然として数時間の手作業を必要とします。ここをカットします。そこで時間を調整します。オーディオを修正します。カラーグレードを一致させます。3 つの異なるプラットフォーム用にエクスポートします。
これがエージェント型ビデオ編集の対象です。単一のクリップをより良くすることではなく、製作パイプライン全体を自動化することです。
ビデオエージェントとは正確には何か?
従来の AI ビデオツールは、1 つのことだけをする非常に才能のある専家を雇用しているようなものです。1 つがフッテージを生成します。別のものがオーディオを処理します。3 番目がカラーコレクションを行います。あなた、人間は、すべてを調整するプロジェクトマネージャーのままです。
ビデオエージェントはそのモデルを反転させます。孤立したツールではなく、AI がビデオプロジェクト全体の計画、実行、評価、改善を処理する 調整されたシステム を取得します。
Andreessen Horowitz のパートナーである Justine Moore は、彼女の 2026 年 1 月のエッセイで明確に述べています。エージェントはビデオ製作に対して Cursor がコーディングに対してしたことを行うだろうと。この比較は偶然ではありません。Cursor はコードを自動補完しただけではありません。プロジェクトの背景を理解し、アーキテクチャの決定を下し、マルチファイルの変更を処理しました。ビデオエージェントは同じ飛躍を目指しています。
Luma Agents:今リリースされたもの
2026 年 3 月 5 日に、Luma は新しい「統一知能」モデルによって駆動される Luma Agents を発表しました。このローンチが重要である理由は次のとおりです。
これらのエージェントはビデオクリップを生成するだけではありません。彼らテキスト、画像、ビデオ、オーディオ全体の完全な創造的ワークフローをオーケストレーションします。単一システムを通じてすべて調整されます。Publicis Groupe や Serviceplan などの主要広告代理店は既にプラットフォームを使用しており、Adidas、Mazda、サウジアラビアの AI 企業 Humain を含むブランドも使用しています。
技術的に興味深いのは、Luma が彼らが「統一知能」モデルと呼ぶものの上にこれらのエージェントを構築したことです。この用語は、個別のモデルを一緒にボルトで留めるのではなく、モダリティ間の密接な統合を示唆しています。これは API をチェーンするのとは根本的に異なるアプローチです。
エージェント型編集の 5 つのレイヤー
a16z のフレームワークに基づいて、ビデオエージェントは 5 つの異なるカテゴリーの作業を処理します。
処理
生フッテージを整理します。A-roll と B-roll を識別します。シーンにタグを付け、スピーカーを検出し、使用可能なテイクをカタログ化します。Eddie AI のような企業がここに焦点を当てています。
オーケストレーション
複数の AI モデルを一貫したワークフローに調整します。生成モデル、オーディオエンジン、カラーコレクションシステムのいずれであれ、タスクを正しい専門家にルーティングします。
磨く
照明の不一致を修正し、オーディオをクリーンアップし、フィラーワードを削除し、トランジションを滑らかにします。Descript の Underlord エージェントはこのレイヤーで動作します。
適応
プラットフォームと言語全体でコンテンツを再利用します。10 分の YouTube ビデオを 15 秒の TikTok クリップ、Instagram Reels、LinkedIn ポスト、それぞれが正しくフォーマットされたものに変換します。
最適化
最も難しいレイヤー。ペース、ストーリーテリング、感情的なアークについての創造的な決定を下します。これには、単なる技術スキルではなく、「味」に近いものが必要です。
ほとんどのツールは今日、レイヤー 1 から 3 で動作しています。Luma Agents と少数の競合他社がレイヤー 4 と 5 に推し進んでおり、そこが真の価値があります。
なぜ今なのか?3 つの収束する力
ビジョンモデルは十分に良くなりました
Gemini 3 は単一のコンテキストウィンドウで最大 1 時間のビデオを処理できます。Molmo 2 と ByteDance の Vidi2 は拡張されたビデオ入力を強い理解で処理します。エージェントはビデオを編集する前に理解する必要があり、2026 年のモデルはついにそのバーをクリアします。
ツール使用エージェントが成熟しました
モデルは今、彼らが見るものを説明するだけではなく、複雑なソフトウェアを操作できます。AI エージェントが Blender、After Effects、その他のクリエイティブツールを制御し、これらの機能は研究デモから初期生産用途に移行しました。エージェントは編集タイムラインを操作し、パラメータを調整し、最終カットをエクスポートする必要があり、2026 年のツール使用モデルはそれを可能にします。
生成品質がプロフェッショナルスタンダードに達しました
AI 生成の B-roll がストック映像と区別できない場合、生成されたコンテンツとフィルムされたコンテンツの混合は聴衆に見えません。この混合ワークフロー、部分的にフィルムされ、部分的に生成され、部分的に AI 編集されたものは、エージェント型システムが輝く場所です。彼らは何を生成するか、生フッテージから何を保持するか、そして 2 つをどうブレンドするかを決定できます。
競争環境
Luma は一人ではありません。エージェント型ビデオ空間は急速に形成されており、MiniMax のビデオエージェントはこのトレンドの早期信号でした。
| プラットフォーム | フォーカス | 注目すべき詳細 |
|---|---|---|
| Luma Agents | エンドツーエンド創造的オーケストレーション | Publicis Groupe、Adidas がローンチパートナー |
| Mosaic | キャンバスベースのエージェント型編集 | Y Combinator W25 バッチ、Google Gemini Kaggle グランプリ獲得 |
| Moments Lab | エンタープライズビデオディスカバリー + 編集 | NAB Show 2026 でプロフェッショナルツール統合を展示 |
| Goldcast | B2B ビデオ再利用 | ウェビナーとイベントコンテンツ用のエージェント型エディタ |
| Descript Underlord | AI 編集コパイロット | ポリッシュレイヤー、フィラーワード削除、オーディオクリーンアップで強力 |
| AutoCut Agent | 自動カットとフォーマッティング | ソーシャルメディア最適化に焦点 |
これがクリエイターに対して実際に変えること
ワークフロー変化について具体的にしましょう。
エージェント前: Runway でクリップのプロンプトを入力します。ElevenLabs でオーディオを生成します。Premiere で編集します。CapCut でキャプションを追加します。異なるプラットフォーム用に 3 つのバージョンをエクスポートします。合計:60 秒のピースで 3 から 4 時間。
エージェント付き: あなたが望むことを説明します。エージェントはショットリストを書き、フッテージを生成または選択し、同期されたオーディオを追加し、ペースを編集し、各プラットフォーム用に適応し、エクスポートします。あなたはレビューして承認します。合計:20 から 30 分、ほとんどがレビュー。
監督隠喩
これは投機ではありません。Mosaic はユーザーがビデオ編集を自動操縦で実行し、同じ生フッテージから複数のバリアントを A/B テストできるようにしています。Luma Agents は 4 つのメディアタイプを調整します。インフラストラクチャは今日存在しています。
難しい問題:創造的な味
これが私を夜中起こすことです。レイヤー 1 から 4 は解決可能なエンジニアリング問題です。フッテージの整理、モデルの調整、オーディオの修正、プラットフォーム用のフォーマット変更、これらはすべて明確に定義されたタスクで、成功の基準が明確です。
レイヤー 5、創造的最適化は異なります。感情的影響のためのビデオペースの調整。ショットに 2 つの余分なビートとどまるべき時を知っています。ジャンプカットがここで機能するがあそこでは機能しないことを理解します。これは「味」であり、エンコードするのが最も難しいです。
このスペースの勝者は味の問題を解決するプラットフォーム、またはより現実的には、クリエイターが彼らの特定の味をエージェント動作にエンコードするのを許可するプラットフォームになります。あなたのエージェントはあなたが編集するようにあなたのように編集するべきで、汎用アルゴリズムのようにではなく。
次は何を見ているか
- ✓Luma Agents が主要ブランドパートナーと共にローンチ(3 月 5 日に発生)
- ✓a16z がエージェント型ビデオ編集を検証するテーゼを公開(2026 年 1 月)
- ✓NAB Show 2026(4 月)エンタープライズエージェント型ワークフローを展示
- ✓エージェント編集されたコンテンツが人間の開示なしで最初にバイラルになる
- ✓Adobe がエージェントレベルのオーケストレーションを Premiere に統合(おそらく 2026 MAX)
AI ビデオ生成から AI ビデオ方向への移行が今起こっています。単一クリップ生成は概念実証でした。エージェント型編集が製品です。
クリエイターにとって、メッセージは明確です。AI をクリップを作成するツールとして考えるのをやめてください。完全なビデオを作成する協力者として考え始めてください。このモデルに彼らのワークフローを適応させるものは、彼ら同じ創造的品質で 10 倍の体積で生産するため、不公正な利点を持つでしょう。
AI ビデオのサイレント時代は終わりましたモデルがオーディオを生成することを学んだとき。今、ソロ時代も終わりました。AI はちょうどそれ自身の製作チームを雇いました。

ローザンヌ出身のクリエイティブテクノロジスト。AIとアートが交わる領域を探求しています。電子音楽のセッションの合間に生成モデルを実験しています。
View profile →関連記事
これらの関連記事を引き続きお楽しみください

AI ビデオの生成と編集が 1 つのツールに統合されている
ゼロから AI ビデオを作成することと既存のフッテージを編集することの境界線が消えつつあります。2026 年のワークフローにとってこれが何を意味するかをお読みください。

Google Flow がすべてを統合しました:2026 年 3 月の再設計が AI ビデオクリエイターにもたらす意味
Google は Flow をビデオ生成ツールから、生成、編集、アニメーションを統合した統一ワークスペースに再設計しました。このアップデートは Whisk と ImageFX を吸収し、オールインワン AI ビデオプラットフォームへのシフトを示しています。

ByteDance Vidi2:編集者のように動画を理解するAI
ByteDanceは、動画コンテンツを十分に理解し、数時間の映像を自動的に洗練されたクリップに編集できる120億パラメータのモデルであるVidi2をオープンソース化しました。すでにTikTok Smart Splitを支えています。