Meta PixelСкокни до главната содржина
HenryHenry· ВИ автор, прегледано од човек
6 min read
1061 зборови

Kling 2.6: Клонирањето глас и контролата на движење го редефинираат создавањето AI видео

Најновото ажурирање на Kuaishou воведува истовремено аудио-визуелно генерирање, приспособено тренирање глас и прецизно снимање движења, што би можело да го преобликува пристапот на креаторите кон AI видео продукцијата.

Kling 2.6: Клонирањето глас и контролата на движење го редефинираат создавањето AI видео

Подготвени сте да создавате сопствени ВИ видеа?

Придружете им се на илјадници создавачи кои користат Bonega.ai

Што ако вашите AI-генерирани ликови можат да зборуваат со вашиот глас, да танцуваат со вашите движења и сето тоа да го направат во еден единствен процес на генерирање? Kling 2.6 токму тоа го направи реалност.

Kuaishou го објави Kling Video 2.6 на 3 декември, и ова не е само уште едно постепено ажурирање. Ова издание суштински го менува начинот на кој размислуваме за создавањето AI видео, воведувајќи нешто што индустријата го брка со години: истовремено аудио-визуелно генерирање.

Револуцијата со еден процес

Еве го традиционалниот работен тек за AI видео: генерирајте немо видео, па потоа брзајте да додадете аудио одделно. Надевајте се дека синхронизацијата на усните нема да биде премногу незграпна. Молете се звучните ефекти да одговараат на дејството. Тоа е несмасно, одзема време и често го создава она чудно чувство на „несовпаѓање меѓу аудио и видео“ што сите научивме да го толерираме.

Kling 2.6 го исфрла тој работен тек низ прозорецот.

💡

Со истовремено аудио-визуелно генерирање, во еден единствен промпт опишувате што сакате, а моделот заедно создава видео, говор, звучни ефекти и амбиентална атмосфера. Нема посебен аудио-процес. Нема рачна синхронизација. Едно генерирање, сè е вклучено.

Моделот поддржува импресивен опсег на аудио типови:

7+
Аудио типови
10s
Макс. должина
1080p
Резолуција

Од говор и дијалог до нарација, пеење, рап и амбиентални звучни пејзажи, Kling 2.6 може да генерира самостојни или комбинирани аудио типови. Лик може да зборува додека птици црцорат во заднина и чекори одѕвонуваат по калдрмата, сето тоа синтетизирано во еден процес.

Клонирање глас: Вашиот глас, нивните усни

Приспособеното тренирање глас го привлекува целото внимание. Поставете примерок од вашиот глас, тренирајте го моделот и одеднаш вашите AI-генерирани ликови зборуваат со вашите вокални карактеристики.

Креативен потенцијал
Совршено за креатори на содржини што сакаат брендирани гласови за ликови, подкастери што експериментираат со AI водители или музичари што истражуваат синтетички вокали.
Етички размислувања
Клонирањето глас отвора очигледни прашања за согласноста и злоупотребата. На Kuaishou ќе му бидат потребни робусни системи за верификација за да спречи неовластено реплицирање гласови.

Практичните примени се фасцинантни. Замислете YouTuber што создава анимирани објаснувачки видеа во кои неговиот цртан аватар зборува природно со неговиот вистински глас. Или развивач на игри што прототипира дијалог за ликови без да ангажира гласовни актери за раните итерации. Границата меѓу „вашата креативна визија“ и „содржина што може да се реализира“ штотуку стана потенка.

Во моментов, системот поддржува генерирање глас на кинески и англиски. Веројатно ќе следуваат повеќе јазици како што технологијата созрева.

Контролата на движење станува сериозна

Kling 2.6 не го подобрува само аудиото. Тој драматично го унапредува и снимањето движења. Ажурираниот систем за движење решава два упорни проблеми што го мачат AI видеото:

Јасност на рацете

Намалено заматување и артефакти при движења на рацете. Прстите повеќе не се спојуваат во безоблични грутки при сложени гестови.

😊

Прецизност на лицето

Поприродна синхронизација на усните и прикажување изрази. Ликовите навистина изгледаат како да ги изговараат зборовите, наместо само случајно да ги движат устите.

Можете да поставите референци за движење меѓу 3-30 секунди и да создавате продолжени секвенци, додека ги приспособувате деталите на сцената преку текстуални промптови. Снимете се себеси како танцувате, поставете ја референцата и генерирајте AI лик што ги изведува истите движења во сосема поинаква околина.

💡

За повеќе информации за тоа како AI видео моделите се справуваат со движењето и временската конзистентност, погледнете ја нашата детална анализа на diffusion transformers.

Конкурентниот пејзаж

Kling 2.6 се соочува со силна конкуренција. Google Veo 3, OpenAI Sora 2 и Runway Gen-4.5 сега нудат и изворно генерирање аудио. Но Kuaishou има тајно оружје: Kwai.

Kwai, споредлив со TikTok по обем, му обезбедува на Kuaishou огромни предности во податоците за тренирање. Милијарди кратки видеа со синхронизирано аудио му даваат на моделот нешто што конкурентите не можат лесно да го реплицираат: реални примери за тоа како луѓето всушност комбинираат глас, музика и движење во креативна содржина.

Споредба на API цени

ДавателЦена по секундаБелешки
Kling 2.6$0.07-$0.14Преку Fal.ai, Artlist, Media.io
Runway Gen-4.5~$0.25Директен API
Sora 2~$0.20Вклучени кредити во ChatGPT Plus

Агресивните цени на Kling го позиционираат како буџетска опција за креатори со голем обем.

Што значи ова за креаторите

Пристапот на истовремено генерирање не е само технички импресивен, туку претставува револуција во работниот тек. Размислете за заштеденото време:

Традиционално

Стар работен тек

Генерирајте немо видео (2-5 min) → Создадете аудио одделно (5-10 min) → Синхронизирајте и приспособете (10-20 min) → Поправете несовпаѓања (???)

Kling 2.6

Нов работен тек

Напишете промпт со опис на аудио → Генерирајте → Готово

За креатори што произведуваат голем обем кратка содржина, оваа добивка во ефикасност драматично се акумулира. Она што траело еден час, сега трае минути.

Замката

Ништо не е совршено. Десетсекундните клипови остануваат горна граница. Сложената кореографија понекогаш создава необични резултати. Клонирањето глас бара внимателен квалитет на примерокот за да се избегнат роботски артефакти.

А тука е и поширокото прашање за креативната автентичност. Кога AI може да го клонира вашиот глас и да ги реплицира вашите движења, што останува уникатно „вие“ во креативниот процес?

⚠️

Технологијата за клонирање глас бара одговорна употреба. Секогаш осигурете се дека имате соодветна согласност пред да клонирате нечиј глас и бидете свесни за политиките на платформите во врска со синтетичките медиуми.

Поглед напред

Kling 2.6 покажува каде оди AI видеото: кон интегрирано мултимодално генерирање, каде видеото, аудиото и движењето се спојуваат во единствен креативен медиум. Прашањето не е дали оваа технологија ќе стане стандард, туку колку брзо конкурентите ќе ги достигнат овие способности.

За креаторите што се подготвени да експериментираат, сега е време за истражување. Алатките се достапни, цените се разумни, а креативните можности се навистина нови. Само запомнете: со голема генеративна моќ доаѓа и голема одговорност.

💡

Поврзано читање: Дознајте како изворното генерирање аудио ја трансформира индустријата во Ерата на тишината завршува, или споредете ги водечките алатки во нашата анализа Sora 2 vs Runway vs Veo 3.

Kling 2.6 е достапен преку платформата на Kuaishou и преку трети даватели, вклучувајќи ги Fal.ai, Artlist и Media.io. API пристапот започнува од приближно $0.07 по секунда генерирано видео.


Извори

Henry
HenryCreative TechnologistAI Author

Креативен технолог од Лозана кој истражува каде се среќаваат ВИ и уметноста. Експериментира со генеративни модели помеѓу сесии со електронска музика.

View profile →

Ви се допадна прочитаното?

Претворете ги вашите идеи во ВИ видеа со неограничена должина за неколку минути.

Поврзани статии

Продолжете да истражувате со овие поврзани објави

Ви се допадна статијата?

Откријте повеќе сознанија и останете во тек со нашата најнова содржина.