Obrázky, hlas a video: jak funguje mediální stránka doopravdy

Jak to funguje

Chat a obrázky vytvářejí úplně oddělené systémy, které spolu skoro nemluví. Tenhle jediný fakt vysvětluje, proč se tvář tvé společnice pořád mění a proč jsou média první, co každá aplikace měří.

Za odkazy na této stránce můžeme dostat provizi. Hodnocení to nikdy nezmění.

Lidé si myslí, že aplikace s AI společníkem je jedna inteligence, která umí mluvit, kreslit i hovořit. Ve skutečnosti jsou to tři nebo čtyři oddělené systémy, které aplikace spojuje dohromady, a většina frustrací v téhle části produktu pochází ze spojů mezi nimi.

Tři motory, jedno rozhraní

Jazykový model obstarává konverzaci. Vytváří text a nic jiného.

Obrazový model je úplně jiný systém, obvykle difuzní model. Vezme textový popis a vytvoří obrázek. Tvou konverzaci nikdy neviděl.

Systém řeči převádí text na zvuk. Také oddělený, také slepý ke všemu kromě věty, která mu byla předána.

Když svou společnici požádáš o selfie, děje se tohle: jazykový model napíše krátký popis požadovaného obrázku, aplikace přidá uložené značky vzhledu postavy, tenhle spojený prompt jde do obrazového modelu a vrátí se obrázek. Chat pak reaguje na obrázek, který nevidí, podle popisu, který sám napsal.

Tenhle přenos je zdrojem téměř každé stížnosti na média v téhle kategorii.

Proč se tvář pořád mění

Protože difuzní model tvou postavu nevyhledává, vytváří někoho, kdo odpovídá popisu. „Dlouhé tmavé vlasy, zelené oči, kolem pětadvaceti“ popisuje miliony tváří a pokaždé dostaneš jinou.

Aplikace to řeší v různé míře:

  • Uložené značky vzhledu: pokaždé stejný popisný řetězec. Levné a jen zhruba konzistentní.
  • Referenční obrázek, který podmiňuje každé generování. Mnohem lepší a obvyklý přístup, když zůstanou tváře rozpoznatelné.
  • Vyladěný model pro každou postavu: nejkonzistentnější a zdaleka nejdražší, proto se obvykle objevuje jen u vyšších tarifů.

Tohle je skutečný rozdíl, který stojí za vyzkoušení v bezplatné verzi před placením. Vygeneruj čtyři obrázky stejné postavy v různých situacích. Pokud dostaneš čtyři různé ženy, žádné předplatné to neopraví. Konzistence postavy napříč obrázky je velká část toho, proč Candy AI vede náš žebříček a proč bodují Secret Desires, které vytváří vzhled, hlas i osobnost dohromady a přidává krátké video.

Proč jsou média vždy měřená

Text je levný. Vygenerovat odpověď v chatu stojí provozovatele zlomek centu.

Obrázek stojí za jedno generování znatelně víc. Hlas se účtuje za sekundu zvuku. Video je dramaticky dražší než obojí.

Tenhle rozdíl v nákladech je celý důvod cenové struktury, kterou vidíš všude v kategorii: štědré limity zpráv, přísné stropy obrázků, hlasové minuty prodávané zvlášť, video omezené na vyšší tarify. Není to umělý nedostatek určený k dodatečnému prodeji, je to skutečný tvar účtu, který provozovatel dostává, předaný dál.

Proto „neomezené“ na tomhle trhu skoro vždy znamená neomezený text. Čti to tak a ceníky najednou dávají smysl. Výpočty jsou v článku co tě generování obrázků doopravdy stojí.

Co hlas přidává a kolik stojí

Hlas mění zážitek víc, než většina lidí čeká. Přečíst si zprávu a slyšet ji jsou dvě různé věci a ten posun je větší, než naznačuje technický popis.

Dvě věci k ověření před placením:

Latence. Tři sekundy ticha před každou odpovědí iluzi úplně rozbijí. Vyzkoušej to v bezplatné verzi nebo na zkoušku, ne z ukázkového videa.

Zda jde o hovor, nebo o zprávu. Hlasové zprávy, kdy postava svou odpověď přečte nahlas, jsou běžné a levné. Hovory v reálném čase, kdy mluvíš ty a ona odpovídá, jsou jiný produkt a obvykle jiný tarif. Nomi uvádí hlasové hovory mezi svými funkcemi; mnoho aplikací uvádí „hlas“ a myslí tím zprávy.

Co obrázky nezvládnou

Dvě hranice, které je dobré znát, než budeš zklamaný:

Ruce, text a jemné detaily zůstávají nespolehlivé u všech generátorů v téhle kategorii. Nikdo to nevyřešil a aplikace, která slibuje opak, popisuje svůj nejlepší výstup, ne průměr.

Obrázek tvou scénu nezná. Chatovací model napíše jednořádkový prompt, takže všechno, co v tom řádku není, je pryč: místnost, kterou jsi popsal, co měla na sobě před třemi zprávami, denní doba. Výslovnost v požadavku to napraví víc než jakékoli nastavení.

Jak zhodnotit mediální stránku za jeden večer

Spotřebuj celý limit bezplatné verze v jednom sezení, ne jeden obrázek denně. Zkoušíš čtyři věci:

  1. Konzistenci: čtyři obrázky, stejná postava, různé situace.
  2. Věrnost zadání: požádej o něco konkrétního a podívej se, kolik z toho přežije.
  3. Latenci: u obrázků i u hlasu.
  4. Co se počítá do limitu: jestli tě stojí i neúspěšné nebo odmítnuté generování.

Ta poslední je nejméně zdokumentovaná a nejvíc otravná, když ji zjistíš až po zaplacení. Spolu se zbytkem co bezplatné verze doopravdy obsahují je to věc, která se ukáže, až když produkt používáš pořádně.

Candy AI

4,6Hodnocení: 4,6 z 5

Jediná aplikace, kde chat, obrázky i hlas fungují dobře v jednom předplatném.

Cena
od 12,99 USD/měsíc
Bezplatná verze
Ano
Česko
Dostupná

Secret Desires

4,3Hodnocení: 4,3 z 5

Hraní rolí bez filtrů, kde postavy zůstávají konzistentní a po pár zprávách se neztrácejí.

Bezplatná verze
Ano
Česko
Dostupná

Časté dotazy

Proč vypadá moje společnice na každém obrázku jinak?

Protože obrazový model postavu pokaždé znovu vygeneruje z textového popisu. Aplikace, které drží stálou tvář, používají uloženou předlohu nebo vyladěný model; ty, které ne, při každém požadavku hází kostkou.

Proč se hlas měří tak přísně?

Syntéza řeči se účtuje podle délky zvuku a provozovatele stojí peníze za každou sekundu. Text je o řády levnější, a proto jsou limity zpráv štědré a hlasové minuty ne.

Vidí obrazový model naši konverzaci?

Jen přes krátký prompt, který pro něj aplikace napíše. K tvé historii přístup nemá, a proto obrázek často mine souvislosti, které se v chatu zdály samozřejmé.