Alibaba Wan 3.0: Umělá inteligence, která promění prezentace ve videa se zvukem

  • Wan 3.0 generuje videa o délce až 30 sekund z textu, obrázků, zvuku, PDF souborů nebo webových stránek.
  • V jedné generaci přijímá jako reference až 10 obrázků, 5 videí a 5 zvukových souborů.
  • Ve výchozím nastavení obsahuje synchronizovaný zvuk a umožňuje převést PowerPoint do namluveného videa.
  • K dispozici ve veřejné beta verzi na Model Studiu s rozlišením 480p, 720p a 1080p.

Alibaba Wan 3.0

Společnost Alibaba představila Wan 3.0, svůj nový model umělé inteligence pro generování videí z písemných pokynů, obrázků, klipů, zvuku nebo dokumentů. Nástroj, který je již k dispozici ve veřejné beta verzi prostřednictvím Model Studio, umožňuje uživatelům vytvářet scény o délce až 30 sekund s integrovaným pohybem kamery, dialogy a zvukovými efekty. Toto spuštění přichází jen několik týdnů poté, co čínská společnost představila Qwen 3.8-Max, svůj špičkový jazykový model, a posiluje svůj závazek ke generativnímu multimediálnímu obsahu.

Nejvýraznější vlastností Wan 3.0 je jeho schopnost transformovat prezentaci v PowerPointu, PDF nebo webovou stránku do namluveného videa. Uživatel jednoduše napíše výzvu, připojí referenční materiál a umělá inteligence se postará o vytvoření audiovizuálního díla s mluveným vysvětlením, animacemi a automatickým zpracováním. Tato funkce otevírá dveře k převodu technických dokumentů nebo školicích materiálů do videí bez nutnosti ruční úpravy.

AliExpress, jedna z největších platforem elektronického obchodování
Související článek:
Stránky podobné AliExpressu

Více referencí a delší doba trvání

Jedním z nejvýznamnějších vylepšení Wan 3.0 oproti jeho předchůdci je podpora více typů referencí. Model dokáže v jednom požadavku kombinovat až deset obrázků, pět videoklipů a pět zvukových souborů spolu s dokumentem nebo webovou stránkou, která poskytuje kontext. To umožňuje vytvářet složité scény s mnohem větší narativní soudržností než v předchozích verzích.

Maximální délka klipu se zdvojnásobila, z 15 sekund ve Wan 2.7 na současných 30 sekund. Uživatelé si však mohou délku ručně upravovat sekundu po sekundě nebo nechat systém doporučit vhodnou délku na základě složitosti instrukce. Dostupná výstupní rozlišení jsou 480p, 720p a 1080p s pevnými nebo přizpůsobitelnými poměry stran pro různé platformy.

Automaticky generovaný a synchronizovaný zvuk

Další významnou novou funkcí je, že Wan 3.0 generuje zvuk ve výchozím nastavení. Postavy mohou mluvit nebo zpívat synchronizovaně se scénou a umělá inteligence také zahrnuje ambientní zvuky, které odpovídají vizuálnímu obsahu. Tato funkce je obzvláště užitečná pro vysvětlující videa, krátké reklamy nebo školicí materiály, kde je koordinace mezi obrazem a zvukem nezbytná. V případě potřeby si uživatelé mohou také vyžádat klip bez zvuku a později přidat hlasový komentář nebo soundtrack.

Synchronizace rtů, pohybu a zvukových efektů byly výrazně vylepšeny, čímž se snížily nekonzistence běžné v předchozích generacích. Díky tomu je Wan 3.0 praktickým nástrojem pro tvorbu video tutoriálů, softwarových ukázek nebo obsahu pro sociální média bez nutnosti produkčního týmu.

Konverze dokumentů a omezení

Vlajkovou funkcí Wan 3.0 je převod prezentací a dokumentů do namluvených videí. Umělá inteligence dokáže číst PDF, prezentaci nebo webovou stránku a použít její obsah jako základ pro generování audiovizuální sekvence. Například prezentaci v PowerPointu s několika snímky lze transformovat do videa, které vysvětluje její hlavní body pomocí filmečků, textu na obrazovce a hlasového komentáře. Existuje však jedno významné omezení: najednou lze zpracovat pouze jeden dokument nebo webovou stránku, nikoli oba současně.

Alibaba také vylepšila vykreslování digitálních prvků, jako jsou softwarová rozhraní, pohyblivá grafika a text v obraze. Tento typ obsahu je pro tvůrce videa často problematický, ale WAN 3.0 snižuje zkreslení mezi snímky, což usnadňuje vytváření technických a školicích videí s přijatelnou vizuální přesností.

Dostupnost a profesní orientace

Wan 3.0 je k dispozici ve veřejné beta verzi prostřednictvím Model Studia, platformy pro vývoj umělé inteligence od Alibaba Cloud. Vzhledem k tomu, že je stále ve fázi testování, se výkon a doba generování mohou lišit. Společnost cílí na tento nástroj pro profesionály, kteří potřebují vytvářet krátké reklamy na sociálních sítích, školicí materiály pro roboty nebo převádět technické dokumenty do namluvených videí. Předpokládá také jeho využití v korporátním sektoru, kde automatické generování videí z prezentací může ušetřit hodiny práce.

Spuštění WAN 3.0 přichází v době, kdy generování videa s využitím umělé inteligence získává na významu. Na rozdíl od jiných modelů, které jsou stále v experimentální fázi, se Alibaba rozhodla nabídnout veřejný přístup od prvního dne, což uživatelům umožňuje testovat nástroj a hlásit chyby. Tato strategie je v kontrastu se strategií ostatních konkurentů, kteří byli při uvádění svých systémů na trh opatrnější.

Stručně řečeno, Wan 3.0 se prezentuje jako všestranné řešení pro vytváření videí z více zdrojů se synchronizovaným zvukem a maximální délkou trvání 30 sekund. Jeho schopnost převádět dokumenty do audiovizuálních podob z něj činí atraktivní volbu pro firmy a tvůrce obsahu, ačkoli omezení pouze na jeden zdroj na generaci a maximální rozlišení 1080p nechávají prostor pro zlepšení. Veřejná beta verze je již aktivní a bude zajímavé sledovat, jak se model v nadcházejících měsících vyvine.


Přidat jako preferovaný zdroj v Googlu