Meta PixelZum Hauptinhalt springen
AlexisAlexis· KI-Autor, von Menschen geprüft
6 min read
1099 Wörter

Alibaba Wan 2.7: Wie der Thinking Mode die KI-Videogenerierung verändert

Alibaba hat gerade Wan 2.7 mit einem neuartigen Thinking Mode veröffentlicht, der Kompositionen plant, bevor Videos generiert werden. Wir erläutern, wie er funktioniert und was er für Kreative bedeutet.

Alibaba Wan 2.7: Wie der Thinking Mode die KI-Videogenerierung verändert

Bereit, deine eigenen KI-Videos zu erstellen?

Schließe dich Tausenden von Kreativen an, die Bonega.ai nutzen

Alibabas Tongyi Lab veröffentlichte Wan 2.7 am 6. April 2026 und führte einen "Thinking Mode" ein, der grundlegend verändert, wie KI-Videomodelle Prompts verarbeiten. Statt Frames direkt aus Text zu generieren, erstellt das Modell zunächst einen internen Plan der Szene und setzt ihn anschließend um. Die Ergebnisse sprechen für sich: weniger Artefakte, bessere Kohärenz und deutlich bewusster gestaltete Kompositionen.

Was ist der Thinking Mode?

Die meisten Videogenerierungsmodelle arbeiten in einem einzigen Durchlauf. Du gibst einen Prompt ein, das Modell beginnt, Rauschen in Pixel zu diffundieren, und du erhältst, was auch immer daraus entsteht. Das funktioniert bei einfachen Szenen recht gut, bricht aber zusammen, wenn Prompts mehrere Subjekte, spezifische räumliche Beziehungen oder komplexe Handlungen enthalten.

Wan 2.7 fügt einen Zwischenschritt hinzu. Bevor Pixel generiert werden, führt das Modell Folgendes aus:

  1. Es analysiert den Prompt in semantische Komponenten (Subjekte, Handlungen, Umgebung, Beleuchtung)
  2. Es plant die Komposition, indem es bestimmt, wo Elemente erscheinen und wie sie interagieren sollen
  3. Es generiert die Ausgabe und nutzt diesen Plan als strukturelle Orientierung
💡
Stell dir den Unterschied zwischen dem Improvisieren eines Gemäldes und dem vorherigen Anfertigen einer Kompositionsskizze vor. Die Skizze erscheint nicht im fertigen Werk, prägt aber jeden Pinselstrich.

Das ähnelt der Art, wie "Chain-of-Thought"-Reasoning große Sprachmodelle verbessert hat. Indem das Modell gezwungen wird, vor dem Handeln nachzudenken, verbessert sich die Ausgabequalität erheblich, insbesondere bei komplexen Prompts.

Die vollständige Wan-2.7-Suite

Wan 2.7 ist nicht nur ein Modell. Es wird als Suite aus vier Modellen für unterschiedliche Generierungs-Workflows ausgeliefert:

4
Modell-Suite
$0.10/s
API-Preisgestaltung
Apr 6
Veröffentlichungsdatum
ModellEingabeAusgabeAm besten geeignet für
Text-zu-VideoText-PromptVideoclipErstellung von Grund auf
Bild-zu-VideoBild + PromptVideoclipAnimieren von Standbildern, Concept Art
Referenz-zu-VideoReferenzvideo + PromptNeues VideoStiltransfer, Neuerstellung
VideobearbeitungVideo + BearbeitungsanweisungenModifiziertes VideoPostproduktion, Korrekturen

Das Text-zu-Video-Modell ist seit dem 3. April bereits auf Together AI verfügbar. Die verbleibenden drei Modelle werden in den kommenden Wochen ausgerollt.

Unter der Haube: Architektur-Einblicke

Alibaba hat zwar noch kein vollständiges Paper veröffentlicht, doch aus der API-Dokumentation und frühen Benchmarks sind mehrere technische Details hervorgegangen.

Was wir wissenWas es auszeichnet
Auf der Wan-Architekturlinie (Wanxiang) aufgebautErstes Produktionsmodell mit expliziter Kompositionsplanung
Thinking Mode fügt vor der Diffusion einen Planungsschritt hinzuSzenen mit mehreren Elementen verarbeiten 5+ Subjekte sauber
Hyperrealistische Charakterkonsistenz über Frames hinwegText in generierten Videos ist lesbar, nicht verstümmelt
Präzise Farbsteuerung durch Prompt ConditioningFarbgenauigkeit bleibt bei Änderungen der Beleuchtung konsistent
Hervorragendes Rendering langer Texte (Text in Videos)Komplexe Kamerabewegungen bewahren räumliche Kohärenz

Die Fähigkeit zum Rendering langer Texte ist besonders bemerkenswert. Frühere Modelle hatten Schwierigkeiten, lesbaren Text innerhalb von Videoframes zu erzeugen. Wan 2.7 verarbeitet Schilder, Beschriftungen und sogar kurze Absätze mit überraschender Genauigkeit. Für Kreative, die Text-Overlays direkt im generierten Material benötigen, ist das ein bedeutender Fortschritt.

Benchmarking im Vergleich zum Markt

Die KI-Videolandschaft hat sich diese Woche deutlich verschoben: Wan 2.7 erscheint genau zu dem Zeitpunkt, an dem OpenAI die Einstellung von Sora bestätigte und Google die Preise für Veo 3.1 stark senkte.

ModellPreisgestaltungAudioMaximale LängeCharakterkonsistenzThinking/Planung
Wan 2.7$0.10/sNein~10sStarkJa
Veo 3.1 Lite$0.05/sJa~8sGutNein
Veo 3.1 Fast$0.12/sJa~8sStarkNein
Kling 3.0~$0.08-0.17/sJa~10sStarkNein
Seedance 2.0GebündeltJa15sGutNein
Runway Gen-4.5~$0.15/sNein~10sStarkNein
⚠️
Wan 2.7 enthält keine native Audiogenerierung. Für Projekte, die synchronisierten Ton benötigen, brauchst du eine separate Audio-Pipeline oder ein Modell wie Kling 3.0 oder Veo 3.1, das Audio nativ generiert.

Mit $0.10 pro Sekunde positioniert sich Wan 2.7 preislich im wettbewerbsfähigen Mittelfeld. Es kostet doppelt so viel wie Googles günstige Lite-Option, ist mit Kling 3.0 konkurrenzfähig (dessen Preis je nach Plattform variiert) und deutlich günstiger als Runway.

Wann Wan 2.7 einsetzen?

Basierend auf frühen Tests und den Stärken des Modells sind dies die Szenarien, in denen Wan 2.7 am sinnvollsten ist:

🎬

Komplexe Szenen mit mehreren Subjekten

Der Thinking Mode überzeugt, wenn dein Prompt mehrere interagierende Charaktere oder Objekte umfasst. Der Planungsschritt verhindert die räumliche Verwirrung, unter der andere Modelle leiden.
📝

Textintensive Inhalte

Wenn dein Video lesbaren Text, Schilder oder UI-Elemente benötigt, ist das Text-Rendering von Wan 2.7 derzeit erstklassig.
🎨

Präzise Farb- und Stilsteuerung

Das System zur Farbsteuerung ermöglicht es dir, genaue Paletten festzulegen und sie über alle Frames hinweg beizubehalten, was für markenkonsistente Inhalte nützlich ist.
🔄

Stiltransfer über Referenzen

Das Referenz-zu-Video-Modell (bald verfügbar) ermöglicht es dir, einen vorhandenen Clip als Stilvorlage einzuspeisen und neue Inhalte zu generieren, die dessen visuelle Sprache übernehmen.

Für einfachere Szenen mit einem einzelnen Subjekt, bei denen du außerdem Audio benötigst, können Modelle wie Kling 3.0 oder Veo 3.1 weiterhin die bessere Wahl sein. Der Planungs-Overhead des Thinking Mode schafft vor allem dann Mehrwert, wenn Prompts komplex sind.

Was das für die Branche bedeutet

Der Thinking Mode von Wan 2.7 deutet auf einen umfassenderen Wandel bei der Funktionsweise generativer Modelle hin. Anstatt Ausgaben nur mit roher Rechenleistung aus Rauschen zu erzwingen, werden künftige Modelle wahrscheinlich explizite Planungsphasen für verschiedene Aspekte der Generierung integrieren.

Wir sehen dieses Muster bereits in anderen Bereichen. Modelle zur Codegenerierung planen vor dem Schreiben. Bildmodelle verwenden Layout Conditioning. Jetzt lernen Videomodelle, nachzudenken, bevor sie etwas erschaffen.

💡
Das rasante Tempo der Modellveröffentlichungen im Jahr 2026 macht es riskant, sich dauerhaft an einen einzelnen Anbieter zu binden. Pipeline-basierte Ansätze, die Generierungs-Backends austauschen können, sobald bessere Modelle erscheinen, schützen deinen Workflow vor Vendor Lock-in.

Der Wettbewerbsdruck ist real. Da Sora aussteigt, Google Preise senkt und chinesische Modelle wie Wan 2.7 und Kling 3.0 die Qualitätsgrenzen verschieben, hatten Kreative noch nie mehr Optionen oder mehr Gründe, flexibel zu bleiben.

Für einen tieferen Einblick darin, wie diese Modelle in spezifischen Benchmarks abschneiden, sieh dir unsere Analyse der Leistung von Runway Gen-4.5 an. Und wenn dich interessiert, wie der Rollout von Seedance 2.0 das CapCut-Ökosystem verändert, haben wir das letzten Monat ausführlich behandelt.


Quellen

Alexis
AlexisAI EngineerAI Author

KI-Ingenieur aus Lausanne, der Forschungstiefe mit praxisnaher Innovation verbindet. Teilt seine Zeit zwischen Modellarchitekturen und Alpengipfeln auf.

View profile →

Gefällt dir, was du gelesen hast?

Verwandle deine Ideen in wenigen Minuten in KI-Videos unbegrenzter Länge.

Ähnliche Artikel

Entdecke weitere passende Beiträge

Hat dir dieser Artikel gefallen?

Entdecke weitere Einblicke und bleibe mit unseren neuesten Inhalten auf dem Laufenden.