Alibaba Wan 2.7: Wie der Thinking Mode die KI-Videogenerierung verändert
Alibaba hat Wan 2.7 mit einem neuartigen Thinking Mode veröffentlicht, der Kompositionen plant, bevor das Video generiert wird. Wir analysieren die Funktionsweise und die Bedeutung für Kreative.

Bereit, Ihre eigenen KI-Videos zu erstellen?
Schließen Sie sich Tausenden von Creators an, die Bonega.ai nutzen
Was ist der Thinking Mode?
Die meisten Modelle zur Videogenerierung arbeiten in einem einzigen Durchlauf. Sie geben einen Prompt ein, das Modell beginnt, Rauschen in Pixel umzuwandeln, und Sie erhalten das Ergebnis. Das funktioniert bei einfachen Szenen ausreichend gut, versagt jedoch bei Prompts mit mehreren Subjekten, spezifischen räumlichen Beziehungen oder komplexen Aktionen.
Wan 2.7 fügt einen Zwischenschritt hinzu. Bevor auch nur ein Pixel generiert wird, durchläuft das Modell folgende Schritte:
- Analyse des Prompts in semantische Komponenten (Subjekte, Aktionen, Umgebung, Beleuchtung)
- Planung der Komposition durch Festlegung, wo Elemente erscheinen und wie sie interagieren sollen
- Generierung des Ergebnisses unter Verwendung dieses Plans als strukturelle Leitlinie
Dies ähnelt der Art und Weise, wie „Chain-of-Thought"-Reasoning große Sprachmodelle verbessert hat. Indem das Modell gezwungen wird, vor dem Handeln nachzudenken, verbessert sich die Ausgabequalität erheblich, insbesondere bei komplexen Prompts.
Die vollständige Wan 2.7 Suite
Wan 2.7 ist nicht nur ein einzelnes Modell. Es wird als Suite aus vier Modellen ausgeliefert, die verschiedene Generierungs-Workflows abdecken:
| Modell | Eingabe | Ausgabe | Optimal für |
|---|---|---|---|
| Text-to-Video | Text-Prompt | Videoclip | Erstellung von Grund auf |
| Image-to-Video | Bild + Prompt | Videoclip | Animation von Standbildern, Concept Art |
| Reference-to-Video | Referenzvideo + Prompt | Neues Video | Stiltransfer, Nachbildung |
| Video Editing | Video + Bearbeitungsanweisungen | Bearbeitetes Video | Postproduktion, Korrekturen |
Das Text-to-Video-Modell ist seit dem 3. April auf Together AI verfügbar. Die übrigen drei Modelle werden in den kommenden Wochen schrittweise ausgerollt.
Unter der Haube: Architektur-Einblicke
Obwohl Alibaba noch kein vollständiges Paper veröffentlicht hat, sind aus der API-Dokumentation und ersten Benchmarks mehrere technische Details bekannt geworden.
| Was wir wissen | Was es auszeichnet |
|---|---|
| Basiert auf der Wan-Architekturlinie (Wanxiang) | Erstes Produktionsmodell mit expliziter kompositorischer Planung |
| Der Thinking Mode fügt vor der Diffusion einen Planungsschritt hinzu | Multi-Element-Szenen bewältigen 5+ Subjekte sauber |
| Hyperrealistische Charakterkonsistenz über Frames hinweg | Textdarstellung im generierten Video ist lesbar, nicht verzerrt |
| Präzise Farbsteuerung durch Prompt-Conditioning | Farbgenauigkeit bleibt bei Beleuchtungswechseln konstant |
| Überlegene Darstellung langer Texte (Text in Videos) | Komplexe Kamerabewegungen bewahren die räumliche Kohärenz |
Die Fähigkeit zur Darstellung langer Texte ist besonders bemerkenswert. Frühere Modelle hatten Schwierigkeiten, lesbaren Text in Videobildern zu generieren. Wan 2.7 bewältigt Schilder, Beschriftungen und sogar kurze Absätze mit überraschender Genauigkeit. Für Kreative, die Texteinblendungen direkt in generiertes Videomaterial integrieren müssen, ist dies ein bedeutender Fortschritt.
Vergleich mit der Konkurrenz
Die KI-Videolandschaft hat sich diese Woche erheblich verschoben. Wan 2.7 erschien genau zu dem Zeitpunkt, als OpenAI die Einstellung von Sora bestätigte und Google die Preise für Veo 3.1 senkte.
| Modell | Preis | Audio | Max. Länge | Charakterkonsistenz | Thinking/Planning |
|---|---|---|---|---|---|
| Wan 2.7 | $0,10/s | Nein | ~10s | Hoch | Ja |
| Veo 3.1 Lite | $0,05/s | Ja | ~8s | Gut | Nein |
| Veo 3.1 Fast | $0,12/s | Ja | ~8s | Hoch | Nein |
| Kling 3.0 | ~$0,08-0,17/s | Ja | ~10s | Hoch | Nein |
| Seedance 2.0 | Inklusive | Ja | 15s | Gut | Nein |
| Runway Gen-4.5 | ~$0,15/s | Nein | ~10s | Hoch | Nein |
Der Preis von $0,10 pro Sekunde positioniert Wan 2.7 im wettbewerbsfähigen Mittelfeld. Das ist doppelt so viel wie Googles günstige Lite-Option, konkurrenzfähig mit Kling 3.0 (dessen Preis je nach Plattform variiert) und deutlich günstiger als Runway.
Wann Sie Wan 2.7 einsetzen sollten
Basierend auf ersten Tests und den Stärken des Modells sind hier die Szenarien, in denen Wan 2.7 am sinnvollsten ist:
Complex Multi-Subject Scenes
Text-Heavy Content
Precise Color and Style Control
Style Transfer via Reference
Für einfachere Szenen mit einem einzelnen Subjekt, bei denen zusätzlich Audio benötigt wird, sind Modelle wie Kling 3.0 oder Veo 3.1 möglicherweise weiterhin die bessere Wahl. Der Planungsaufwand im Thinking Mode bringt seinen Mehrwert speziell bei komplexen Prompts.
Was das für die Branche bedeutet
Der Thinking Mode von Wan 2.7 deutet auf einen grundlegenden Wandel in der Funktionsweise generativer Modelle hin. Anstatt Ergebnisse mit reiner Rechenleistung aus Rauschen zu erzwingen, werden zukünftige Modelle voraussichtlich explizite Planungsphasen für verschiedene Aspekte der Generierung integrieren.
Dieses Muster zeigt sich bereits in anderen Bereichen. Code-Generierungsmodelle planen vor dem Schreiben. Bildmodelle verwenden Layout-Conditioning. Jetzt lernen auch Videomodelle, vor der Erstellung nachzudenken.
Der Wettbewerbsdruck ist real. Mit dem Rückzug von Sora, Googles Preissenkungen und chinesischen Modellen wie Wan 2.7 und Kling 3.0, die die Qualitätsgrenzen verschieben, hatten Kreative noch nie so viele Optionen, und noch nie so viele Gründe, flexibel zu bleiben.
Für einen detaillierteren Vergleich dieser Modelle anhand spezifischer Benchmarks lesen Sie unsere Analyse der Runway Gen-4.5 Performance. Und wenn Sie sich dafür interessieren, wie der Rollout von Seedance 2.0 das CapCut-Ökosystem verändert, haben wir das letzten Monat ausführlich behandelt.

KI-Ingenieur aus Lausanne, der Forschungstiefe mit praktischer Innovation verbindet. Teilt seine Zeit zwischen Modellarchitekturen und Alpengipfeln auf.
View profile →Verwandte Artikel
Entdecken Sie weitere verwandte Beiträge

Alibaba HappyHorse-1.0: Das unbekannte Modell, das alle KI-Video-Ranglisten anführt
Ein Modell namens HappyHorse-1.0 tauchte ohne Zuordnung auf Artificial Analysis auf, stieg in Text-to-Video und Image-to-Video auf Platz 1 und stellte sich als Alibaba-Projekt heraus. Hier ist, was wir über die Architektur, das Team und die Auswirkungen auf den KI-Video-Markt wissen.

KI-Video nach Sora: 4 Marktsegmente, die Sie 2026 kennen sollten
Sora wird am 26. April eingestellt. Der KI-Videomarkt hat sich in vier Segmente konsolidiert. Ein praktischer Leitfaden zur Auswahl der richtigen Sora-Alternative für Ihre Anforderungen.

Google Veo 3.1 wird kostenlos: 10 KI-Videos pro Monat für jedes Google-Konto
Google hat Veo 3.1 für alle persönlichen Konten mit 10 kostenlosen Videogenerierungen pro Monat geöffnet. Was Sie erhalten, wo die Grenzen liegen und warum das für KI-Video-Ersteller wichtig ist.