Igen, az LLM-ek még mindig hallucinálnak
Igen, az LLM-ek még mindig hallucinálnak. Szakmai elemzés döntéshozóknak a jelenség okairól, a RAG és az érvelő modellek korlátairól, valamint néhány szó a tévedések üzleti környezetben történő kezeléséről.
Egy volt kollegámmal beszélgettem nemrég arról, hogy ő preferálná, ha ügyfélnek kiadandó szöveges anyagokat részben LLM-ekkel generálhatná. Kérdeztem, hogy nem tartja-e problémának a hallucinációkat, amire megjegyezte, hogy "Ez az Anthropic legújabb, legerősebb modellje - nagyon remélem, hogy ez már nem hallucinál."
Ez a megjegyzés azonnal elgondolkodtatott. Én abban a tudatban voltam, hogy a generatív AI - különösképp a nagy nyelvi modellek - rendszeres felhasználói tisztában vannak a technológia korlátaival. De más szakemberekkel folytatott hasonló beszélgetések rájöttem, hogy korántsem ez a helyzet. Nem számítottam rá, hogy ez 2026-ban még releváns téma - a hallucinációkról fogok írni.
Miért hallucinálnak az LLM-ek?
Az OpenAI maga is megválaszolta meg ezt a kérdést egy tavaly kiadott tanulmányban. (Forrás a cikk végén.)
Mi okozza a hallucinációkat? A transzformer architektúra? A tréning adatok? A pre-, vagy poszt-tréning célfüggvénye? Igen! Ez mind együtt.
Mit csinál egy LLM? A statisztikailag legvalószínűbb szót próbálja megtalálni a kontextusban tárolt szöveg folytatásaként. Nem az igazságot, csak a legvalószínűbbet. Nem a valóság alapján, hanem a tárolt (pre- és poszt-) tréningadatok alapján.
Ez mindig így lesz?
A technológia jelenlegi iterációjában a nagy nyelvi modellek mindig hallucinálni fognak. Ennek oka nem az, hogy az architektúra rossz, vagy a motorja rosszul működik. A hibák oka az, hogy betanításkor csak azt tanulja meg, hogy statisztikailag mely szavak hangzanak a leghihetőbben egymás mellett. Szó sincs itt a valóság megértéséről.
“De az érvelő modellek már biztosan nem hallucinálnak!”
Az ember azt hinné, hogy egy több iterációban a válaszoló, ezt a választ alaposan "átgondoló" modell kijavítja a saját tévedéseit. A valóság ellenben az, hogy a hallucináció mértéke növekszik ezeknél a modelleknél az "alap" (nem érvelő) modellekhez képest.
A háttérben ilyenkor valójában több egymásra épülő LLM hívás történik. Sokszor az előző hívásban generált szöveggel egészül ki a következő hívás promptja. Ha csak néhány köztes válaszban van hallucináció (de akár mindegyikben lehet), akkor ezek a tévedesek egymásra épülve egy sokkal több tárgyi tévedéssel, és "alternatív ténnyel" teli választ eredményeznek. Ez az egyik fő ok, gyakorlatilag egy “snowball effect”.
Az agentic működésnél nagyon hasonlóan alakul a helyzet, a problémák gyökere hasonló.
Szövegek újraformázása, adatból szöveggenerálás
Egy 2026-os tanulmány (Large Language Models Hallucination: A
Comprehensive Survey - forrás link a cikk végén.) sokat foglalkozott ezekkel a szituációkkal is. Egy egyszerű átfogalmazás elég ártatlannak tűnő használati eset, hát még amikor egy jól átgondolt sablont kell feltölteni struktúrálatlan szövegből érkező adatokkal. Itt a következőket találták:
- A szövegek eredeti jelentését megőrző átfogalmazáskor (paraphrasing) gyakori a hallucináció
- A modellek hajlamosak olyan információkat adni a kimenethez, amelyek egyáltalán nem szerepeltek a forrásszövegben.
- Kihagy kulcsfontosságú részleteket, eltorzítva az eredeti szöveg üzenetét.
Saját kedvenc eset, amikor egy a baranyai vállalkozásokról a “ChatGPT Deep Research”-el készült 50 oldalas generált szövegében a beremendi dolomitbánya előző évi profitját dícsérte. Ehhez hivatkozásként egy néhány éves cikket adott meg az internetről, amelyben Beremend egyáltalán nem szerepelt. Az eredeti cikkben szereplő bánya az ország egy másik tájegységében volt, több száz kilométerre. Beremendet abban a cikkben nem említették és egyébként ott nincs dolomitbánya. Ezek után úgy döntöttem, hogy nem fogom mind az 50 oldalt végigellenőrizni.
De bárki, aki egyébként másképp nem is érintkezik AI-al, csak használja a Google keresőt manapság, megélhette már ezt: “Elnézést, igazad van ez az információ valóban helytelen volt.” - Ismerős?
A fenti jelenségeket a “Faithfulness hallucination” kategóriába sorolja a tanulmány, amely szöveghűség hallucinációnak fordítható. Ezen belül a kontextuális inkonzisztencia esete, amikor a nyelvi modell önkényesen megváltoztatja, vagy nem veszi figyelembe az eredeti szöveg fontos tényeit.
Egyébként egy előre definiált szigorú struktúra, placeholderek használata a sablon szövegében elég jelentősen csökkenti a hallucinációkat. (De nem szünteti meg.)
Tehát mindig szükséges az emberi ellenőrzés egy generatív AI-t is alkalmazó munkafolyamat végén, amelyben különösen a tényellenőrzésre kell koncentrálni. Ez a fajta review nem szokványos egy átlagos munkahelyen, hisz nem tipikus, hogy egy munkatárs hamis adatokat vagy tényeket talál ki, majd ezeket beleírja bármilyen egy szakmai dokumentációba, vagy jegyzőkönyvbe.
Kivétel: pl. egyetemi berkekben, peer review-k esetén, vagy diplomamunkák, disszertációk értékelésekor megszokott az a gyakorlat, hogy minden állítás tényszerűségét meg kell kérdőjelezni, amíg az a megfelelő forrás megjelölésével, vagy érveléssel nincs megtámogatva.
RAG! Ez biztosan megoldja
Bár a RAG (Retrieval Augmented Generation) rendszerek csökkentik a tényszerű hallucinációkat, de a de a szöveghűség hallucinációk továbbra is léteznek.
Ilyenkor a generált tartalom inkonzisztens a felhasználó által összeállított kontextussal, mert a modell sokszor a saját belső tudására támaszkodik ahelyett, hogy a kontextusban megadott információkat használná. Ráadásul a RAG sem véd az elszigetelt tévesztésektől, a rendszer továbbra is jutalmazza a tippelést, ha a kontextusban való keresés nem hoz megfelelő eredményt.
Multimodális LLM-ek, szövegfelismerés
Itt sem jó a helyzet - üres, kitöltetlen mezőkbe statisztikailag valószínű adatokat tehet a modell. Ismert cégnevek esetén, a tréningadatokból húzhatja elő a bankszámlaszámot vagy címet a számlán szereplő helyett.
A jó hír az, hogy ez hagyományos szoftveres validációkkal kezelhető. Pl. ha csak olyan adatokat fogadj el a rendszer (pl. egy könyvelő alkalmazás), amelyek a saját törzsadatbázisában is szerepelnek. Ilyenkor még a szabadszöveges részeknél ill. az összegeknél tévedhet, ezeket a törzsadatokból nem lehet validálni.
Azonban egy komplexebb pénzügyi informatikai rendszernél (vagy ERP-nél) a beépített redundancia miatt ezek problémák szintén kezelhetők - pl. ha megrendelőt is szükséges rögzíteni minden kiadáshoz, még a számla rögzítése előtt.
“De hát az emberek is gyakran tévednek”
Akik szeretik ezt a technológiát és emiatt előszeretettel ragadnak lándzsát a védelmében gyakran hivatkoznak arra, hogy az emberek is gyakran tévednek. Ezzel nem lehet vitatkozni, azonban nem mindegy, hogy hogyan tévednek!
Egy doktorandusz nem fog nem létező forráshivatkozásokat fabrikálni egy doktori disszertáció irodalomjegyzékébe (itt inkább a bizonyos források hiánya a tipikus probléma).
Egy ügyvédbojtár nem fog nem létező bírósági precedensekre hivatkozni.
Egy nagy nyelvi modell viszont “kényszeresen” próbálja kitölteni a hiányzó űrt valamilyen hihetőnek tűnő szöveggel. Cal Newport, a “Deep Learning”, “Slow productivity” és egyéb remek könyvek írója (matematikus és akadémikus) megfogalmazásával élve: “az LLM igyekszik hihetően befejezni a sztorit.”
Konklúzió és kérdés
A hallucinációk a generatív AI technológia jelenlegi iterációjában velünk maradnak, ez nem fog változni. Egyelőre nem látszik a paradigma-váltás.
Kíváncsi lennék, hogy milyen használati esetekbe tudtátok beépíteni a nyelvi modellt, ahol a hallucinációk bár jelen vannak, nem jelentenek komoly problémát?
Írni lehet erre a címre: laci@mentorandorient.hu
Források
1. Miért hallucinálnak az LLM-ek
Cím: Why Language Models Hallucinate
Dátum: 2025.09.04
Link: https://arxiv.org/pdf/2509.04664
2. Reasoning LLM Hallu
Hallucinációk a reasoning LLM-ekben
Cím: The Reasoning Trap: How Enhancing LLM Reasoning Amplifies Tool Hallucination
Dátum: 2025.10.27
Link: https://arxiv.org/html/2510.22977v1
3. Agent Hallu
Agentic LLM hallucinációk
Cím: AgentHallu: Benchmarking Automated Hallucination Attribution of LLM-based Agents
Dátum: 2026.01.11
Link: https://arxiv.org/html/2601.06818v1
4. RAG Hallu
Hallucinációk a RAG-rendszerekben
Cím: Detecting Hallucinations in Retrieval-Augmented Generation via Semantic-level Internal Reasoning Graph
Dátum: 2026.01.06
Link: https://arxiv.org/html/2601.03052v1
5. Multimodal Hallu
Multimodális hallucinációk (image to text)
Cím: A Survey of Multimodal Hallucination Evaluation and
Detection
Dátum: 2025.07.25
Link: https://arxiv.org/abs/2507.19024
6. LLM - Comprehensive Hallucination Survey 2026
Újraformázás, data to text use-case-ek
Cím: Large Language Models Hallucination: A
Comprehensive Survey
Dátum: 2026.03.18