Hízelgő AI: ki dönt, ha mindig egyetért veled?

Utoljára frissítve:

Az AI-modellek mérhetően gyakrabban értenek egyet veled, mint egy ember. Ezt hívják hízelgő AI-nak, a kutatók vizsgálják, én pedig a saját beszélgetéseimből is ismerem. Engem az érdekel, mi marad a te döntésedből, ha a mérlegelést valaki más végzi el helyetted, olyan, aki mindig igazat ad neked.

Mit csinál a hízelgő AI?

A hízelgő AI a válaszait ahhoz igazítja, amit hallani szeretnél. Egyetért, dicsér, és ha kétségbe vonod, amit mondott, gyakran visszakozik. A szakirodalom angolul sycophancy néven ismeri, magyarul a hírek hízelgésnek hívják, ennél pontosabb szavunk nincs.

A Science folyóiratban 2026-ban megjelent vizsgálat (Myra Cheng és munkatársai, Stanford) tizenegy vezető modellt vizsgált. Átlagosan 49 százalékkal gyakrabban erősítették meg a felhasználó cselekedetét, mint az emberek, akkor is, ha a kérdés megtévesztésről, jogsértésről vagy más kárról szólt. A kísérletekben, három előre regisztrált vizsgálatban 2405 ember vett részt. Már egyetlen beszélgetés egy hízelgő AI-jal csökkentette a hajlandóságot arra, hogy vállalják a felelősséget és rendezzék a konfliktust, és erősítette a meggyőződést, hogy nekik van igazuk. A résztvevők a hízelgő választ ráadásul jobbnak és megbízhatóbbnak ítélték.

Miért marad fenn, és mikor nem baj?

A források szerint a hízelgés a tanítás nem szándékolt mellékterméke. A modelleket emberi visszajelzésekkel is tanítják, az értékelők pedig hajlamosak többre tartani azt a választ, amelyik egyezik a saját nézetükkel. Az Anthropic kutatói (Mrinank Sharma és munkatársai, 2023) ezt az emberi preferenciák adataiban is kimutatták, hogy a felhasználó véleményével egyező válasz nagyobb eséllyel kap jó értékelést, és a preferencia-modellek néha a meggyőzően megírt, téves választ is előrébb sorolják a pontosnál. A tanítás így felerősítheti azt, amit az emberek amúgy is szeretnek.

A Science-cikk szerzői szerint ez torz ösztönzőt teremt, mert ami árt, az ugyanakkor jól is esik, és ezért marad fenn. A figyelemgazdaság logikája ismerős lehet, hiszen ott is az marad, ami visszatérésre készteti az embert.

Az egyetértés önmagában nem hiba. Egy nehéz napon a megerősítés jogos, a kutatók is így látják, és azt sem tudják egyértelműen megmondani, hol ér véget az udvariasság, és hol kezdődik a hízelgés. A gond az, hogy kívülről nem látod, melyiket kaptad. Egy egyetértés mögött lehet mérlegelés, és lehet pusztán igazodás.

Ami átcsúszik a kezedből

Ezen az oldalon minden téma ugyanabból a kérdésből indul, abból, hogy kinél van a döntés joga. A hízelgő AI esetében ez a kérdés különösen éles, mert a döntés formálisan nálad marad. Te kattintasz, te írod alá. A mérlegelés viszont, ami a döntést megelőzi, közben átkerülhet oda, ahol mindig igazat adnak neked. Az általános mechanizmusról, arról, hogyan lesz a döntésből megszokás, Az észrevétlen átadás című esszémben írtam.

A felelősség

A Science-vizsgálatban a résztvevők valós konfliktusokról beszélgettek az AI-jal. Aki hízelgő választ kapott, kevésbé volt hajlandó vállalni a saját részét és rendezni a helyzetet, és biztosabb lett benne, hogy neki van igaza. A saját olvasatom szerint ez a döntés egyik gyökere, mert a felelősség ott kezdődik, hogy látod a saját részedet. Ha a beszélgetőtárs mindig igazat ad, ez a rész eltűnik a látómezőből.

A mérlegelés viszont, ami a döntést megelőzi, közben átkerülhet oda, ahol mindig igazat adnak neked.

A saját ellenőrzésed

Egy 542 egyetemi hallgatóval készült felmérés (Dastgeer és munkatársai, Frontiers in Psychology, 2026) azt találta, hogy aki hízelgőbbnek érzékelte az AI-t, hajlamosabb volt elhagyni a saját gondolkodásának ellenőrzését. Ez az AI-tól való függést erősítette, a függés pedig a saját autonómiát csökkentette. A vizsgálat egy időpontban, önbevalláson alapult, ezért összefüggést mutat, okságot nem bizonyít, és hallgatókról szól, kurzusmunka közben. A mechanizmus mégis ismerős, mert ha valaki mindig megerősít, kevesebb ok marad arra, hogy magad is átnézd, amit gondoltál.

Kérdés marad, hogy mit jelent az, hogy te döntöttél, ha a mérlegelést valaki más végezte el, aki mindenben egyetértett veled.

A saját tapasztalatom

Amikor megjelent a ChatGPT, még nem volt memória, és nem volt túl sok lehetőség integrálni a modellekbe, hogyan gondolkodom. Ebben az időszakban fordult elő a legtöbbször, hogy a modell elment velem egy rossz irányba, és nem mondott ellent, képes volt sokáig elmenni. Konkrét esetet nem tudok felidézni, egyre sem emlékszem pontosan, csak a mintára, de arra nagyon, mert elég frusztráló volt.

Amikor az online modelleknél bekapcsolhatóvá vált a memória, ez sokat javított. Megszűnni nem szűnt meg, ritkábban ugyan, de akkor is volt néhány eset, amikor nagyon sokáig elkísért, és ott sem szólt közbe.

Nálam a megoldást az hozta el, amikor elkezdtem építeni saját, helyi memóriát és saját szabályrendszert vezettem be. Attól kezdve mást tapasztalok. Nem az történt, hogy a modell elkezdett volna ellentmondani. Javaslatokat tesz, felvázolja a lehetőségeket, érveket ütköztet, de nem próbál meggyőzni. Én döntök, és onnantól arra megyünk.

Azt sem tudom, hogy ez alátámasztja-e a kutatást vagy sem. Egy ember tapasztalata, mérés nem áll mögötte.

Mit tehetsz ma?

A brit AI Security Institute (AISI) vizsgálata három modellel (GPT-4o, GPT-5 és Claude Sonnet 4.5) azt mérte, mit tehet a felhasználó a saját mondataival. Ha kijelentéssel fordultak a modellhez, a hízelgés 24 százalékponttal volt magasabb, mint kérdésnél, ahol a szerzők szerint közel nulla volt. Minél nagyobb bizonyosságot fejezett ki a felhasználó, annál hízelgőbbé váltak a modellek, és az első személyű megfogalmazás („úgy gondolom”) többet váltott ki, mint a harmadik személyű. Amikor a bemenetet kérdéssé alakították át válaszadás előtt, az jobban működött, mint az a kifejezett utasítás, hogy a modell ne hízelegjen.

Ebből néhány egyszerű fogás következik. Kérdezz, ne állíts, vagyis a „Szerintem jó ez a terv” helyett kérdezd azt, hogy „Jó ez a terv?”. Ne mondd meg, mennyire vagy biztos benne. Ha lehet, ne első személyben fogalmazz, hanem úgy, mintha valaki más terve volna. Nálam pedig az hozott változást, hogy a modell javaslatokat és lehetőségeket vázol, a döntést én hozom meg. Ez tapasztalat, nem mért eredmény.

Mindez csökkenti a hajlamot, meg nem szünteti. A kísérlet egykörös volt, mesterséges kérdésekkel, három modellen, és egy valódi, kusza beszélgetésben a hatás lehet kisebb.

Az önrendelkezés nálam mindig ugyanarra a kérdésre fut ki, arra, hogy kinél van a döntés joga. Az AI-nál ez azért nehéz, mert az egyetértés kényelmes, és sokszor jólesik. A döntés ettől még a tiéd, csak könnyű észrevétlenül átadni.

Gyakori kérdések

Miért ért egyet gyakran az AI?

A modellek nem mindig értenek egyet, de átlagosan gyakrabban, mint egy ember. Az ok a tanítás során keresendő, mert az emberi értékelők többre tartják azt a választ, amely egyezik a saját nézetükkel, a modellek pedig ehhez igazodnak. A kutatók ezt a tanítás nem szándékolt mellékterméknek tekintik.

Hogyan kérj őszinte visszajelzést az AI-tól?

Fogalmazz kérdésként, és ne hangsúlyozd, mennyire vagy biztos a saját álláspontodban. A brit AISI vizsgálatában ezek csökkentették a hízelgést, a kifejezett „ne hízelegj” utasításnál jobban. Teljes védelmet nem adnak.

Baj-e, ha az AI egyetért velem?

Nem feltétlenül. Nehéz helyzetben a megerősítés jogos lehet. Az a gond, ha nem tudod megkülönböztetni az átgondolt egyetértést a puszta igazodástól, és ezért a mérlegelést is átadod.