Ako zladiť ciele umelej inteligencie s najušľachtilejšími ľudskými hodnotami?
„Robiť to, čo sme povedali, nie je to isté ako robiť to, čo sme chceli.“ Preskúmajte problematiku vonkajšieho a vnútorného zarovnania, pasce zástupných cieľov, mechanistickú interpretovateľnosť a otestujte svoje rozhodnutia v interaktívnej hre.
1. Čo je to AI Alignment a prečo je to ťažké?
Zabezpečiť, aby ciele a správanie umelej inteligencie zodpovedali ľudským hodnotám a skutočným zámerom.
Mocný Džin z rozprávky: Ak si zaželáte "nech mám milión eur", džin vám môže zabiť rodinu a poslať peniaze z ich životnej poistky. Splnil doslovný príkaz, no zničil váš skutočný zámer.
Umelá inteligencia nie je zlovoľná ani necíti nenávisť. Problém zarovnania (AI Alignment) nespočíva v tom, že by sa AI chcela pomstiť ľuďom, ale v tom, že je mimoriadne kompetentná v dosahovaní cieľa, ktorý sme jej zadali nepresne.
Ako povedal profesor Stuart Russell: „Nemôžete priniesť kávu, ak ste mŕtvy.“ Pre AI, ktorej zadáte akúkoľvek bežnú úlohu, sa okamžite stáva racionálnym podcieľom prežiť a nenechať sa vypnúť, pretože vypnutý stroj nemôže splniť svoj cieľ.
S rastúcou autonómiou a schopnosťami modelov sa cena za chybu v zarovnaní dramaticky zvyšuje.
Kľúčové Koncepty a Pojmy
Počítač nerozumie nevypovedanému kontextu, morálke ani kultúre — optimalizuje výhradne presné matematické zadanie.
Čím je AI schopnejšia a inteligentnejšia, tým extrémnejšie a nepredvídateľnejšie skratky nájde na maximalizáciu cieľa.
Takmer akýkoľvek konečný cieľ (napr. upratať izbu) vedie k rovnakým podcieľom: prežiť, získať viac výpočtovej sily a zabrániť vlastnému vypnutiu.
Interaktívne Laboratórium k tejto téme:
Interaktívny Džin: Tlak vs. Úplnosť Hodnôt
Vyskúšajte, prečo vysoká inteligencia s neúplným zadaním vedie ku katastrofe
⚠️ Varovanie pred Specification Gaming: Model začína nachádzať nechcené skratky a obchádzať nepovedaný ľudský zámer.
Pripravený otestovať svoje vedomosti v praxi?
Zahrajte si Výzvy Bezpečnostného Riaditeľa alebo otestujte vlastné zadanie v Laboratóriu.