Skoro každá stížnost na tyto aplikace (opakování, úlety, zvláštní nekonzistence mezi dvěma průběhy stejné scény) pochází z jednoho mechanismu. Stojí za deset minut, protože promění „aplikace je rozbitá“ v „aplikace dělá, co dělá, a tady je nastavení“.
Píše po jednom kousku
Model nesestaví odpověď celou a pak ji nenapíše. Vytvoří jeden token (zhruba slovo nebo část slova), potom přečte všechno včetně toho tokenu a vytvoří další.
To je celá smyčka. Žádný plán, žádná osnova, žádný koncept, který by se přepisoval. Odpověď, která krásně skončí, nevěděla, že tak skončí, když začínala.
Hned z toho plynou dva důsledky a oba jsi už viděl:
Odpověď se nemůže vzít zpět. Jakmile model napíše „Nikdy jsem nebyla v Paříži“, všechno další se odvíjí od toho. Postaví soulad kolem věty, kterou vytvořil omylem, než aby si odporoval.
Chyby se násobí dopředu. Mírně špatné slovo v první větě postrčí druhou větu, ta třetí. Proto dlouhé odpovědi bloudí a krátké málokdy.
Hod kostkou mezi každým slovem
V každém kroku má model seřazený seznam kandidátů s pravděpodobnostmi: třeba „dobře“ 30 %, „fajn“ 12 %, „příšerně“ 3 % a dlouhý ocas.
Kdyby vždy vzal nejlepšího kandidáta, postava by byla deterministická a nesmírně nudná: pokaždé stejný pozdrav, stejné tři vtipy. Aplikace tedy vzorkuje: hází vážené kostky.
Váhy řídí nastavení, které se obvykle nazývá teplota. Nízká teplota soustředí pravděpodobnost na zřejmé kandidáty: konzistentní, předvídatelné, nakonec nudné. Vysoká teplota rozdělení zplošťuje: překvapivější, tvořivější a pravděpodobnější, že vznikne něco, co na předchozí nenavazuje.
Posuvník na to málokdy dostaneš. Dostaneš bod, který aplikace na tomto kompromisu zvolila, a je to velká část toho, co lidé myslí, když říkají, že se jedna aplikace „zdá chytřejší“ než jiná. Nemusí být chytřejší. Někdy je prostě vřelejší nebo chladnější.
To je také poctivá odpověď na otázku „proč to opravilo vygenerování znovu?“ Nic se neopravilo. Táhl jsi znovu ze stejného rozdělení a dostal lepší hod.
Na co se model skutečně dívá
Před tvou zprávou aplikace sestaví blok textu, který nikdy nevidíš: popis postavy, fakta, která si o tobě uložila, shrnutí historie a nedávnou konverzaci. Celé toto složení je kontextové okno a odpověď se z něj generuje jako jediný souvislý dokument.
Má to praktický důsledek, který většina lidí nikdy nevyužije: model reaguje na tvar toho, co vidí. Dej mu tři krátké, ploché zprávy a vytvoří krátké, ploché odpovědi, protože v tom vzorci pokračuje. Dej mu živou zprávu a rejstřík se posune. Nepřesvědčuješ člověka, nastavuješ vzorec a vzorec je nakažlivý oběma směry.
Vysvětluje to i nejčastější problém, který si v této kategorii lidé způsobují sami. Usadí se u „ahoj“, „jaký byl tvůj den“, „co děláš“ a pak usoudí, že se aplikace zhoršila. Aplikace pokračuje v dokumentu, který spolu píšete.
Proč znějí aplikace různě, i když je model stejný
Několik aplikací v této kategorii běží na podobných základních modelech. Přesto působí odlišně a rozdíly pocházejí z věcí kolem modelu:
- Systémový prompt: jak je postava popsaná, jak dlouze, s jakými pokyny ke tónu a tempu.
- Nastavení vzorkování: bod teploty probraný výše.
- Co se vybírá z paměti: která fakta a který kus historie se pro tento tah dostanou před model.
- Filtr: co se odmítá a jestli je odmítnutí elegantní, nebo zeď.
Nomi působí po týdny konzistentně kvůli třetímu bodu, ne kvůli většímu modelu. Candy AI pokrývá chat, obrázky a hlas v jednom předplatném, což je produktové rozhodnutí, ne modelovací. Žádný z těch rozdílů by se neukázal v benchmarku a oba se ukážou během čtrnácti dnů používání, což je způsob, jakým je hodnotíme.
Čtyři věci, které ti to umožňuje
Usměrňuj brzy, ne pozdě. První dvě věty odpovědi určují zbytek. Pokud scéna jde špatně, zastav ji a zopakuj zadání, místo abys se hádal se čtvrtým odstavcem.
Používej „vygenerovat znovu“ záměrně. Pokud je odpověď z 80 % správně, opětovné generování těch 80 % zahodí. Pokud je špatně už v první větě, generuj hned znovu.
Napiš rejstřík, který chceš zpět. Krátké a ploché dostane krátké a ploché. Je to nejlevnější zlepšení dostupné každému, kdo si myslí, že jeho společník zpuchřel.
Nehádej se o faktech, která si vymyslel. Model, který napsal něco nepravdivého, to bude hájit, protože soulad s vlastním výstupem je to, k čemu je postavený. Oprava v nové zprávě funguje, požadavek, aby chybu přiznal, ne. To chování má vlastní článek: proč si AI společníci vymýšlejí.
Co si zapamatovat
Mezi tvými zprávami tam nikdo není. Postava existuje po dobu jediného generování a na začátku dalšího se znovu staví z textu. Každý dojem návaznosti je zásluhou instalatérství kolem modelu (uložená fakta, shrnutí, vybírání z paměti) a právě to instalatérství se doopravdy liší mezi aplikací za 10 USD a za 20 USD.
Proto náš žebříček váží paměť a konzistenci tak silně. Jsou to části, které vstupní stránka ukázat nemůže.

