„Moderace“ zní jako jedna věc. V aplikacích s AI společníkem jsou to nejméně čtyři, které pracují různou rychlostí a zapojují různé lidi.
Čtyři vrstvy

Každá vrstva vidí méně obsahu, ale podrobněji.
1. Filtry v reálném čase. Každá zpráva, kterou pošleš, i každá odpověď, kterou model napíše, může být před zobrazením zkontrolovaná automatickými klasifikátory. Ty zachytí zakázané kategorie - cokoli s nezletilými, určitý násilný obsah, signály sebepoškozování - a zprávu buď zablokují, odpověď zmírní, nebo ukážou varování. Odtud se berou odmítnutí a krizové karty; náš článek o filtrech obsahu vysvětluje, proč se někdy spustí uprostřed scény.
2. Označování na úrovni konverzace. Odděleně mohou systémy hodnotit celé konverzace nebo účty podle vzorců: opakované pokusy obejít filtr, obtěžování, známky toho, že aplikaci pro dospělé používá nezletilý. Označení není trest; je to poznámka, že se může podívat člověk.
3. Lidská kontrola. Pracovníci pro důvěru a bezpečnost, často u dodavatelů, kontrolují zlomek označených konverzací, hlášení uživatelů a odvolání. Některé firmy také vzorkují běžné konverzace, aby ověřily kvalitu nebo trénovaly modely. Tuhle vrstvu popisují zásady ochrany osobních údajů frázemi jako „ke zlepšování našich služeb“ nebo „k prosazování našich podmínek“.
4. Právní žádosti. Soudy, policie a regulátoři mohou data žádat právními příkazy. Firmy reagují podle své politiky a místního práva.
Co obvykle spustí pohled člověka
| Spouštěč | Proč |
|---|---|
| Obsah týkající se nezletilých | Zákonná povinnost ve většině zemí; často se hlásí dál |
| Signály sebepoškozování nebo sebevraždy | Krizové protokoly dnes vyžaduje zákon v několika státech USA |
| Výhrůžky skutečným lidem | Možná skutečná újma |
| Tvoje vlastní hlášení nebo žádost o podporu | Požádal jsi někoho, aby se podíval |
| Opakované pokusy obejít filtr | Vymáhání podmínek služby |
| Náhodné vzorkování kvality | Zlepšování produktu, pokud to zásady dovolují |
Co přidávají nové zákony
Americké zákony o chatbotech-společnících, počínaje New Yorkem v roce 2025 a Kalifornií v roce 2026, vyžadují, aby aplikace rozpoznávaly projevy sebevražedného myšlení a sebepoškozování a odkazovaly uživatele na krizové služby. Kalifornie navíc vyžaduje, aby firmy podávaly zprávy o svých protokolech. V praxi to znamená víc automatického monitorování nejcitlivějších konverzací, ne míň. Podrobnosti jsou v článku zákony o AI společnících.
Jak k tomu číst zásady
Prohledej zásady ochrany osobních údajů a podmínky na:
- „review“, „moderate“, „human“ (kontrola, moderace, lidé) - jestli lidé čtou konverzace a proč.
- „contractors“ nebo „service providers“ (dodavatelé, poskytovatelé služeb) - jestli kontrolují lidé, kteří pracují pro někoho jiného.
- „improve“, „train“ (zlepšování, trénování) - jestli se běžné chaty vzorkují.
- „law enforcement“, „legal process“, „court order“ (donucovací orgány, právní proces, soudní příkaz) - kdy se data předávají a jestli je potřeba soudní příkaz.
Pečlivé zásady pojmenují spouštěče a řeknou, že kontrolující vidí konverzace jen v případě potřeby. Vágní zásady, které zaměstnancům dovolují přístup ke „veškerému obsahu pro jakýkoli obchodní účel“, ti také něco říkají. Naše čtyři kontroly soukromí pokrývají zbytek dokumentu.
Praktické závěry
- Piš, jako by to mohl číst kontrolující, protože v malém počtu případů číst bude.
- Drž identifikační údaje jiných lidí mimo chaty, zvlášť ve explicitních scénách - kontrolující, který čte označenou konverzaci, je vidí také.
- Když filtr selže ve fikci, obvykle pomůže poznámka mimo roli; hádání se v roli může vyvolat další označení.
- Pokud ti nejvíc záleží na tom, kdo může číst tvoje chaty, jediné nastavení, kde nikdo jiný nemůže, je společník běžící na tvém vlastním počítači - viz AI společník lokálně.
Moderace není totéž co sledování. U drtivé většiny konverzací se nic a nikdo nedívá dál než automatický filtr. Ale o výjimkách rozhodují zásady, ne vřelost aplikace - a stojí za to je znát dřív, než je potřebuješ.