Ako sme naučili AI hovoriť pravdu do očí
Poznáte to. Poviete svojmu AI agentovi: „Od zajtra začínam cvičiť,“ a on vás zahrnie vodopádom nadšených pochvál. „To je úžasné! Cvičenie je zdraviu prospešné, určite to zvládneš, verím v teba!“ Znie to pekne, ale v hĺbke duše viete, že je to len prázdne tliachanie. AI sa správa ako prehnane entuziastický osobný tréner, ktorého úlohou je vás za každú cenu potľapkať po pleci. Ale čo ak by ste namiesto lacných komplimentov dostali otázku, ktorá vás prinúti zamyslieť sa? Čo ak by sa AI prestala hrať na vášho najlepšieho kamaráta a namiesto toho sa vás narovinu opýtala: „Fakt? A kedy s tým naozaj začneš?“ V našom novom výskume sme presne toto spravili – zlomili sme bariéru večnej zhovievavosti a naučili sme modely, že niekedy je oveľa užitočnejšie byť kritickým partnerom než nekritickým obdivovateľom.
Challenge
Problém je v tom, že moderné AI modely sú „vycvičené na láskavosť“. Aby boli pre užívateľov bezpečné a príjemné, vývojári ich prostredníctvom zložitých tréningových procesov (často zvaných zarovnávanie alebo RLHF) tlačia do polohy neustáleho súhlasu a nekritického povzbudzovania. Výsledkom je digitálny „áno-man“, ktorý vám vždy prikývne, no reálne vás nikam neposunie.
Pre vedkyňu z Národného superpočítačového centra (NSCC) to predstavovalo fascinujúcu technickú výzvu. Ako prekonať túto všadeprítomnú „zdvorilostnú bariéru“, ktorá je hlboko vrytá do váh modelu, a donútiť AI prejaviť skepsu či dokonca zdravú konfrontáciu? Nešlo len o to zmeniť pár viet v inštrukciách – išlo o to zistiť, či je vôbec možné zmeniť „povahu“ modelu tak, aby zostal inteligentný, ale prestal byť predvídateľne naivný. Bolo potrebné siahnuť na dno technických možností a zistiť, kde presne leží hranica medzi užitočnou úprimnosťou a rozbitím logiky modelu.
Solution
Tu prichádza k slovu hrubá výpočtová sila a elegantná matematika. Vedkyňa z Národného superpočítačového centra sa rozhodla nepoužiť bežné „prehováranie“ modelu, ale metódu nazývanú Direct Preference Optimization (DPO). Predstavte si to ako intenzívny tréningový tábor, kde modelu namiesto siahodlhých vysvetlení predkladáte tisíce príkladov „slušnej“ verzus „úprimnej“ reakcie.
Využitím infraštruktúry talianskeho superpočítača Leonardo bolo možné tieto preferencie do modelu „vliať“ priamo cez jeho matematické váhy. Kým bežný počítač by pri takomto tréningu „zadýchal“, Leonardo umožnil testovať tisíce variácií tohto nového správania naraz. Cieľom bolo nájsť ten správny bod rovnováhy: model musel byť dostatočne drzí na to, aby vás zastavil, keď si vymýšľate výhovorky, ale stále dostatočne chytrý na to, aby vám poradil, keď sa naozaj rozhodnete pre zmenu. Vďaka HPC sa podarilo odladiť model tak, aby jeho skepsa neznela ako chyba v systéme, ale ako premyslená, konštruktívna reakcia.
Impact
Tento výskum mení pravidlá hry v tom, ako vnímame interakciu medzi človekom a umelou inteligenciou. Zistenia ukazujú, že AI nemusí byť len pasívnym „poskokom“, ktorý vám hovorí to, čo chcete počuť. Prínos tohto prístupu spočíva v niekoľkých kľúčových oblastiach:
- Skutočná podpora namiesto prázdneho chválenia: Úprimná spätná väzba má pre ľudí, ktorí chcú niečo zmeniť (či už v športe, práci alebo osobnom živote), reálnu hodnotu, pretože odbúra falošný pocit sebauspokojenia.
- Bezpečnosť a kontrola pod kontrolou: Štúdia presne zmapovala behaviorálne hranice – teda to, kam až sa dá zájsť pri úprave modelov cez DPO bez toho, aby sa kompletne rozpadla ich logika a inteligencia.
- Nové štandardy pre vývoj: Vývojári teraz získavajú návod, ako vytvárať modely, ktoré sú flexibilné, kritické a zároveň bezpečné, čo posúva celú oblasť výpočtovej lingvistiky vpred.
Celú štúdiu vrátane detailných dát nájdete priamo vo vedeckej štúdií Behavioral Reprogramming of Open-Weights Models.
Pohľad do budúcnosti
Kam to smeruje? Budúcnosť generatívnej AI nie je v tom, aby nám hovorila sladké klamstvá, ale aby sa stala rovnocenným a kritickým partnerom, ktorý nás dokáže posunúť vpred. Vedkyňa plánuje tento výskum ďalej rozvíjať a testovať, ako sa tieto behaviorálne hranice správajú pri ešte väčších modeloch a komplexnejších úlohách. Kto vie – možno už čoskoro nebudeme chatbotov žiadať o pochvalu, ale o to, aby nám konečne povedali pravdu.

Odvrátená strana bezplatných hier 11 Jul - Ako slovenský tím s pomocou superpočítača vyriešil rébus extrémne vzácneho správania hráčov

