Detaljne brojke sa Vectara, AA-Omniscience i FACTS benčmarka, iz OpenAI sistemskih kartica i preko 50 drugih izvora. Ažurira se mesečno.
Poslednje ažuriranje: Mart 2026.
Svaki vodeći AI model halucinira. Pitanje je samo koliko često, na kojim tačno zadacima, i da li to možete da primetite pre nego što vas košta novca.
Ova stranica prati stope halucinacija kroz šest različitih benčmark testova, obuhvata sve najnaprednije (frontier) modele – od GPT-5 do Claude 4.6, Gemini 3.1 i Grok 4.1 – i predstavlja objektivne podatke. Vrednosti iz različitih testova se međusobno ne poklapaju, a u nastavku objašnjavamo zašto je razumevanje tog neslaganja važnije od bilo koje pojedinačne pozicije na rang-listi.
Svaki broj u nastavku dolazi sa drugog benčmarka koji meri različite aspekte halucinacija. Niska Vectara + visoka AA-Omniscience stopa halucinacija znači da je model dobar u sažimanju teksta, ali loš u priznavanju neznanja. Visok FACTS rezultat + niska AA-Omniscience tačnost znači da je model precizan kada koristi alate, ali pokušava da odgovori na previše pitanja u koja nije siguran. Nijedna kolona sama po sebi ne priča celu priču. Gledajte da uvek kombinujete barem dva parametra iz različitih istraživanja.
Vodič kroz kolone / Legenda:
| Model | Provajder | Vectara (Stari) | Vectara (Novi) | AA-Omni Tač | AA-Omni Hal | AA-Omni Indeks | FACTS | HalluHard | CJR Citati |
|---|---|---|---|---|---|---|---|---|---|
| GPT-5.3 Codex | OpenAI | – | – | 51.8% | – | – | – | – | – |
| GPT-5.2 (xhigh) | OpenAI | – | 10.8% | 43.8% | ~78% | – | 61.8 | 38.2% | – |
| GPT-5 | OpenAI | 1.4% | >10% | 40.7% | – | – | 61.8 | – | – |
| GPT-5.1 | OpenAI | – | – | 37.6% | 81% | Pozitivan | 49.4 | – | – |
| GPT-4.1 | OpenAI | 2.0% | 5.6% | – | – | – | 50.5 | – | – |
| o3-mini-high | OpenAI | 0.8% | 4.8% | – | – | – | 52.0 | – | – |
| Claude 4.1 Opus | Anthropic | – | – | – | 0% | – | 46.5 | – | – |
| Claude Opus 4.6 | Anthropic | – | 12.2% | 46.4% | – | 14 | – | – | – |
| Claude Opus 4.5 | Anthropic | – | – | 45.7% | 58% | Negativan | 51.3 | 30% | – |
| Claude Sonnet 4.6 | Anthropic | – | 10.6% | 40.0% | ~38% | – | – | – | – |
| Claude Sonnet 4.5 | Anthropic | – | >10% | – | 48% | – | 49.1 | – | – |
| Claude 3.7 Sonnet | Anthropic | 4.4% | – | – | – | – | – | – | – |
| Claude 4.5 Haiku | Anthropic | – | – | – | 25% | – | – | – | – |
| Gemini 3.1 Pro | – | 10.4% | 55.3% | 50% | 33 | – | – | – | |
| Gemini 3 Pro | – | 13.6% | 55.9% | 88% | 16 | 68.8 | – | – | |
| Gemini 3 Flash | – | – | 54.0% | 91% | – | – | – | – | |
| Gemini 2.5 Pro | – | 7.0% | – | – | – | 62.1 | – | – | |
| Gemini 2.0 Flash | 0.7% | 3.3% | – | – | – | – | – | – | |
| Grok 4 | xAI | 4.8% | >10% | 41.4% | 64% | Pozitivan | 53.6 | – | – |
| Grok 4.1 Fast | xAI | – | 20.2% | – | 72% | – | 36.0 | – | – |
| Grok-3 | xAI | 2.1% | 5.8% | – | – | – | – | – | 94% |
| Perplexity Sonar Pro | Perplexity | – | – | – | – | – | – | – | 37% |
| DeepSeek-V3 | DeepSeek | 3.9% | 6.1% | – | – | – | – | – | – |
| DeepSeek-R1 | DeepSeek | 14.3% | 11.3% | – | 83% | – | – | – | – |
| Llama 4 Maverick | Meta | 4.6% | – | – | 87.6% | – | – | – | – |
Izvori: Vectara HHEM Leaderboard [1], Veštačka Analiza AA-Omniscience [2], Google DeepMind FACTS Benchmark [3], HalluHard Benchmark [5], Columbia Journalism Review [6]. Crtice označavaju nedostatak javno objavljenih podataka za dati model na specifičnom benčmarku.
Najniža stopa halucinacija (zadaci znanja): Claude 4.1 Opus — 0% na AA-Omniscience testu (model bira da odbije odgovor radije nego da nagađa)
Najniža stopa halucinacija (sažimanje): Gemini-2.0-Flash — 0.7% na originalnom Vectara setu podataka
Najviša ocena činjenične tačnosti (višedimenzionalno): Gemini 3 Pro — 68.8 na FACTS testu
Najbolji indeks pouzdanosti znanja: Gemini 3.1 Pro — indeks 33 na AA-Omniscience
Najbolji u realističnim razgovorima: Claude Opus 4.5 — 30% na HalluHard testu (uz omogućenu veb-pretragu)
Najveća preciznost citiranja: Perplexity Sonar Pro — 37% halucinacija na CJR testu (najniže, ali i dalje visoko)
Najveći pojedinačni skok u poboljšanju: Gemini 3.1 Pro — halucinacije su pale za 38 procentnih poena (sa 88% na 50%) uz gubitak tačnosti od samo 1%
Najveća varijabla među svim modelima: Pristup veb-pretrazi — kada je omogućena, smanjuje halucinacije za 73-86%
AI halucinacija se dešava kada veštačka inteligencija izmisli podatak i predstavi ga kao činjenicu. Ona ne signalizira nesigurnost. Ne kaže "Samo nagađam". Umesto toga, isporučuje izmišljene statistike, lažne sudske presude ili nepostojeće istraživačke radove sa istim nivoom samopouzdanja sa kojim bi rešila osnovni matematički zadatak. Dobijeni tekst zvuči savršeno logično. I baš to ga čini izuzetno opasnim.
Halucinacija se odnosi na generisani ispis koji nema utemeljenje u pruženom unosu informacija ili činjeničnoj realnosti. Postoje dva tipa:
Intrinzična halucinacija (neuspeh doslednosti): Model protivreči informacijama koje su mu eksplicitno date. Dajte mu ugovor i tražite sažetak — on će dodati klauzule koje uopšte ne postoje u originalnom dokumentu.
Ekstrinzična halucinacija (činjenični neuspeh): Model generiše informacije koje se ne mogu proveriti ni u jednom poznatom izvoru. On izmišlja činjenice, statistike, citate ili događaje od nule. Nijednom izvornom materijalu nije protivurečeno iz prostog razloga jer nijedan izvorni materijal nije ni konsultovan.
Istraživači sa MIT-a su u januaru 2025. godine otkrili nešto prilično uznemirujuće: AI modeli koriste daleko samouvereniji jezik kada haluciniraju nego kada iznose proverene činjenice. Bilo je 34% više šansi da modeli upotrebe fraze poput "definitivno", "sigurno" i "bez svake sumnje" dok su generisali netačne informacije.
Što je AI model više u krivu, to zvuči sigurnije u sebe.
Veliki jezički modeli (LLM) su mašine za predviđanje, a ne baze znanja. Oni generišu tekst tako što predviđaju koji sledeći "token" (reč ili deo reči) je statistički najverovatniji, na osnovu obrazaca iz podataka na kojima su trenirani. Oni ne razumeju koncept istine. Oni predviđaju uverljivost.
Kada model naiđe na prazninu u svojim podacima ili se suoči sa dvosmislenim upitom, on tu prazninu popunjava nečim što zvuči logično, umesto da prizna da ne zna. Sama arhitektura ovih modela nema ugrađen mehanizam za opciju "Nisam siguran" — ona prosto bira sledeću najverovatniju reč.
I ovo nije "bag" koji će biti ispravljen u sledećem softverskom ažuriranju. Dva nezavisna matematička dokaza su demonstrirala da su halucinacije fundamentalno, dokazivo ograničenje same arhitekture LLM-a. To nije inženjerski nedostatak. To je matematička izvesnost. *(Više o ovome u sekciji "Matematička nemogućnost" u nastavku).* [20][21]
Pre nego što pređemo na same podatke o halucinacijama, važno je razumeti zašto različiti testovi daju drastično različite rezultate za isti model.
Grok-3 beleži odličnih 2,1% na Vectara testu za sažimanje teksta. Međutim, taj isti model postiže katastrofalnih 94% halucinacija na testu tačnosti citiranja (Columbia Journalism Review). Isti model, isti vremenski period, potpuno suprotni zaključci.
Ovo nije greška. Ovi testovi jednostavno mere različite stvari. Tretiranje bilo kog pojedinačnog benčmarka kao "apsolutne stope halucinacija" dovešće vas u zabludu.
Evo šta svaki od ovih testova zapravo meri:
Vectarin model evaluacije (Hughes Hallucination Evaluation Model) daje AI modelu dokument i traži od njega da napravi sažetak koristeći isključivo činjenice iz tog dokumenta. Zatim proverava da li je sažetak dodao nešto čega nije bilo u originalu. Ovo je test doslednosti pri sažimanju — direktan pokazatelj kako se AI ponaša u RAG sistemima (Retrieval Augmented Generation), alatima za pretragu poslovnih podataka i procesima analize dokumenata. [1]
Postoje dve verzije. Originalna verzija koristi oko 1.000 dokumenata. Osvežena verzija (novembar 2025.) koristi 7.700 dužih članaka iz prava, medicine, finansija, tehnologije i obrazovanja. Rezultati na novom setu podataka su znatno lošiji jer je zadatak teži i više odgovara realnim poslovnim scenarijima.
Odličan za: Procenu AI modela za sumarizaciju dokumenata, Q&A iz internih baza znanja i sve situacije gde model ima pred sobom izvorni materijal za rad.
Loš za: Merenje ponašanja modela kada mora da se osloni na sopstveno (ugrađeno) znanje bez izvornih dokumenata.
Agencija Artificial Analysis objavila je ovaj test u novembru 2025. Obuhvata 6.000 pitanja kroz 42 teme u šest domena: biznis, humanističke nauke, zdravstvo, pravo, softversko inženjerstvo i nauka/matematika. [2]
Ključna razlika: "Indeks sveznanja" (Omniscience Index) penalizuje netačne odgovore, ali ne penalizuje odbijanje davanja odgovora. Model koji kaže "Ne znam" dobija bolji skor od onog koji pokuša da pogodi i pogreši. Skala ide od -100 do +100.
Ovo invertuje strukturu podsticaja većine benčmarkova. Umesto da nagrađuje modele za pokušaj odgovora na svako pitanje, AA-Omniscience pita: kada ne znaš, da li ćeš to priznati?
Za većinu modela, odgovor je ne. Samo 4 od 40 testiranih modela ostvarilo je pozitivan indeks.
Odličan za: Evaluaciju da li je model bezbedan za visokorizične savetodavne uloge — pravne, medicinske, finansijske — gde je pogrešan odgovor gori od nikakvog odgovora.
Loš za: Merenje tačnosti sažimanja ili performansi na zadacima baziranim na izvorima.
Google DeepMind-ov FACTS test deli tačnost na četiri segmenta: Činjenična osnova (korišćenje izvora), Multimodalnost (kombinacija vizuelne i tekstualne tačnosti), Parametri (znanje uskladišteno u samom modelu) i Pretraga (tačnost pri korišćenju web alata). Svaki segment dobija sopstvenu ocenu. [3]
Ovaj višedimenzionalni pristup otkriva da modeli imaju dramatično različite prednosti u zavisnosti od vrste zadatka. Grok 4 ostvaruje 75,3 u pretrazi, ali samo 25,7 u multimodalnosti — razlika od 50 poena unutar istog modela.
Odličan za: Razumevanje gde su specifični modeli jaki, a gde slabi kroz različite tipove zadataka.
Loš za: Dobijanje jednog jedinog broja "stope halucinacija". To je i poenta — takav broj ne postoji.
OpenAI-evi SimpleQA i PersonQA testovi proveravaju kratka činjenična pitanja. Ovi benčmarkovi su otkrili zabrinjavajući trend: noviji "reasoning" modeli (sposobni za dublje rezonovanje) ponekad daju lošije rezultate od svojih prethodnika na bazičnim činjenicama. Model o3 halucinira 33% na PersonQA naspram 16% kod o1. Model o4-mini dostiže 48%. [4]
Odličan za: Brzo testiranje tačnosti na jednostavnim pitanjima.
Loš za: Merenje performansi na složenim, višekoračnim ili domenski specifičnim upitima.
Noviji benčmark istraživača iz Švajcarske i Nemačke koji testira modele u realističnim, razgovornim scenarijima umesto u sterilnim uslovima. Čak i najbolji modeli ovde greše u 30-60% slučajeva. Claude Opus 4.5 sa veb-pretragom postigao je najnižu stopu od 30% — ali i dalje greši skoro u trećini slučajeva. [5]
Odličan za: Predviđanje stopa halucinacija u stvarnim chat aplikacijama u produkciji.
Loš za: Kontrolisana, ponovljiva poređenja modela (prevelika varijabilnost).
Columbia Journalism Review je testirao da li AI modeli pravilno pripisuju informacije citiranim izvorima. Perplexity je postigao najbolji rezultat sa 37% halucinacija. Grok-3 je bio najgori sa 94%. Ovaj benčmark je specifično dizajniran za otkrivanje najopasnijeg obrasca: kreiranja pravih URL-ova uz koje se lepe potpuno izmišljene tvrdnje. [6]
Odličan za: Evaluaciju AI za istraživanja, novinarstvo i svaki zadatak koji zahteva pripisivanje izvora.
Loš za: Evaluaciju opšteg znanja ili sažimanja.
TruthfulQA je nekada bio zlatni standard. Sada je delimično zasićen — modeli su već trenirani na njegovim pitanjima. Još gore, istraživači su pokazali da jednostavan algoritam može da postigne rezultat od 79,6% na TruthfulQA višestrukom izboru čak i bez gledanja u samo pitanje, prosto eksploatišući strukturne obrasce u formatiranju odgovora. Citiranje TruthfulQA rezultata za modele iz 2025-2026. je nepouzdano. [29]
HaluEval ima sličan problem. Klasifikator zasnovan na dužini postiže 93,3% tačnosti na HaluEval QA testu prosto označavajući sve odgovore duže od 27 karaktera kao halucinirane. Ovaj benčmark meri dužinu odgovora više nego istinitost. [30]
Nijedan pojedinačni test vam ne daje "univerzalnu stopu halucinacije" bilo kog modela. Ako neko citira samo jedan broj, ili pojednostavljuje radi pogodnosti ili bira podatke radi marketinga.
Odgovoran pristup: uvek ukrstite barem dva testa koja mere različite stvari (jedan zasnovan na izvorima kao Vectara, jedan na otvorenom znanju kao AA-Omniscience), navedite tačnu verziju modela i uslove pozivanja, i obavezno proverite da li je model imao pristup alatima za pretragu interneta. Sekcije koje slede rade upravo to.
Vectara tabela je ubedljivo najcitiraniji benčmark halucinacija u industriji. Postoji u dve verzije, a razlika između njih krije veoma važnu priču. [1]
Na ovom setu (koji se najčešće citira u PR člancima), rezultati deluju veoma ohrabrujuće. Dokumenti su relativno kratki, a zadaci sažimanja prilično jednostavni.
| Model | Provajder | Stopa halucinacija | Činjenična doslednost |
|---|---|---|---|
| Gemini-2.0-Flash-001 | 0.7% | 99.3% | |
| Gemini-2.0-Pro-Exp | 0.8% | 99.2% | |
| o3-mini-high | OpenAI | 0.8% | 99.2% |
| Gemini-2.5-Pro-Exp | 1.1% | 98.9% | |
| GPT-4.5-Preview | OpenAI | 1.2% | 98.8% |
| Gemini-2.5-Flash-Preview | 1.3% | 98.7% | |
| o1-mini | OpenAI | 1.4% | 98.6% |
| GPT-5 / ChatGPT-5 | OpenAI | 1.4% | 98.6% |
| GPT-4o | OpenAI | 1.5% | 98.5% |
| GPT-4o-mini | OpenAI | 1.7% | 98.3% |
| GPT-4-Turbo | OpenAI | 1.7% | 98.3% |
| GPT-4 | OpenAI | 1.8% | 98.2% |
| Grok-2 | xAI | 1.9% | 98.1% |
| GPT-4.1 | OpenAI | 2.0% | 98.0% |
| Grok-3-Beta | xAI | 2.1% | 97.8% |
| Claude-3.7-Sonnet | Anthropic | 4.4% | 95.6% |
| Claude-3.5-Sonnet | Anthropic | 4.6% | 95.4% |
| Llama-4-Maverick | Meta | 4.6% | 95.4% |
| Grok-4 | xAI | 4.8% | ~95.2% |
| Claude-3.5-Haiku | Anthropic | 4.9% | 95.1% |
| Claude-3-Opus | Anthropic | 10.1% | 89.9% |
| DeepSeek-R1 | DeepSeek | 14.3% | 85.7% |
Izvor: Vectara HHEM Leaderboard, GitHub repozitorijum, April 2025 [1]
Google-ovi Gemini modeli ovde dominiraju. OpenAI-eva GPT porodica se grupiše između 0,8% i 2,0%. Čak i najgori rezultati ostaju ispod 15%.
Međutim, ovaj set podataka je prelak. Dokumenti su kratki, a zadaci sažimanja prilično jednostavni, što ne odražava kompleksnost poslovnog sveta.

Vectara HHEM Leaderboard: Kompletna rang-lista modela sa kodiranjem boja po provajderu na originalnom setu podataka. Izvor: Vectara [1]
Vectara je krajem 2025. godine lansirala osveženi benčmark sa dužim dokumentima (do 32.000 tokena) iz oblasti prava, medicine, finansija, tehnologije i obrazovanja. Ova verzija bolje odražava ono sa čime se poslovni AI sistemi zaista suočavaju.
Stope halucinacija su ovde drastično skočile u svim kategorijama:
| Model | Provajder | Stopa halucinacija |
|---|---|---|
| Gemini-2.5-Flash-Lite | 3.3% | |
| Mistral-Large | Mistral | 4.5% |
| DeepSeek-V3.2-Exp | DeepSeek | 5.3% |
| GPT-4.1 | OpenAI | 5.6% |
| Grok-3 | xAI | 5.8% |
| DeepSeek-R1-0528 | DeepSeek | 7.7% |
| Claude Sonnet 4.5 | Anthropic | >10% |
| GPT-5 | OpenAI | >10% |
| Grok-4 | xAI | >10% |
| Gemini-3-Pro | 13.6% |
Izvor: Vectara Rang-lista halucinacija, novi set podataka, Novembar 2025 [1]
Najnoviji Vectara snimak dodaje najnovije frontier modele u evaluaciju novog seta podataka:
| Model | Provajder | Stopa halucinacija |
|---|---|---|
| o3-mini-high | OpenAI | 4.8% |
| GPT-4.1 | OpenAI | 5.6% |
| Grok-3 | xAI | 5.8% |
| DeepSeek-V3 | DeepSeek | 6.1% |
| Command R+ | Cohere | 6.9% |
| Gemini 2.5 Pro | 7.0% | |
| Llama 4 Scout | Meta | 7.7% |
| GPT-5.2-low | OpenAI | 8.4% |
| Gemini 3.1 Pro Preview | 10.4% | |
| Claude Sonnet 4.6 | Anthropic | 10.6% |
| GPT-5.2-high | OpenAI | 10.8% |
| DeepSeek-R1 | DeepSeek | 11.3% |
| Claude Opus 4.6 | Anthropic | 12.2% |
| Grok-4-fast-reasoning | xAI | 20.2% |
Izvor: Vectara HHEM Leaderboard, Snimak istraživačkog izveštaja od 25. februara 2026. [1]
Novi set podataka je razotkrio nešto duboko kontraintuitivno: reasoning modeli (modeli koji poseduju naprednu moć rezonovanja, obično reklamirani kao najsposobniji) — konstantno postižu lošije rezultate kada je u pitanju sažimanje zasnovano isključivo na izvorima. GPT-5, Claude Sonnet 4.5, Grok-4 i Gemini-3-Pro svi su premašili 10%. Grok-4-fast-reasoning verzija je dostigla 20,2%. [48][49]
Hipoteza je jednostavna. "Reasoning" modeli ulažu računarski napor da "promisle" pre nego što odgovore. Tokom procesa sažimanja, to "razmišljanje" ih navodi da sami dodaju zaključke, povezuju koncepte i stvaraju uvide koji suštinski idu dalje od onoga što piše u izvornom dokumentu. To je izuzetno korisno za analizu. Međutim, na testu iz sumarizacije dokumenata — to se računa kao halucinacija.
Ovo stavlja poslovne timove pred bitnu odluku: reasoning mod rada pomaže kod otvorenih zadataka rešavanja problema, ali šteti kod zadataka obrade konkretnih dokumenata. Znanje kada ga treba uključiti, a kada isključiti, postalo je apsolutni imperativ.
Ovaj test postavlja suštinski drugačije pitanje od Vectara-e. Umesto "Da li umeš da napraviš sažetak bez dodavanja informacija?", on pita: "Kada nešto ne znaš, da li ćeš to priznati ili ćeš izmisliti odgovor?" [2]
Ovaj test nagrađuje modele koji poznaju sopstvena ograničenja. Obuhvata 6.000 pitanja kroz 42 teme u šest domena. Indeks sveznanja (Omniscience Index, skala: -100 do +100) penalizuje netačne odgovore, ali ne penalizuje odbijanje. Za većinu modela, svest o neznanju je poražavajuće niska. Samo 4 od 40 testiranih modela ostvarilo je pozitivan indeks.
| Model | Provajder | Tačnost | Stopa halucinacija | Omniscience Indeks |
|---|---|---|---|---|
| Gemini 3 Pro Preview (high) | 55.9% | 88% | 16 | |
| Gemini 3.1 Pro Preview | 55.3% | 50% | 33 | |
| Gemini 3 Flash (Reasoning) | 54.0% | 92% | – | |
| GPT-5.3 Codex (xhigh) | OpenAI | 51.8% | – | – |
| Claude Opus 4.6 (max) | Anthropic | 46.4% | – | 14 |
| Claude Opus 4.5 (thinking) | Anthropic | 45.7% | 58% | Negativan |
| GPT-5.2 (xhigh) | OpenAI | 43.8% | – | – |
| Grok 4 | xAI | 41.4% | 64% | Pozitivan |
| Claude Opus 4.5 | Anthropic | 40.7% | – | – |
| GPT-5 (high) | OpenAI | 40.7% | – | – |
| Claude Sonnet 4.6 (max) | Anthropic | 40.0% | – | – |
| Claude Sonnet 4.6 | Anthropic | 38.0% | ~38% | – |
| GPT-5.1 (high) | OpenAI | 37.6% | 81% | Pozitivan |
Izvor: Artificial Analysis AA-Omniscience, Novembar 2025 - Februar 2026 [2]

AA-Omniscience: Tačnost nasuprot stopi halucinacija. Zeleni kvadrant prikazuje pouzdane modele. Izvor: Artificial Analysis [2]
| Model | Provajder | Stopa halucinacija |
|---|---|---|
| Claude 4.1 Opus (Reasoning) | Anthropic | 0% |
| Claude 4 Opus (Reasoning) | Anthropic | 0% |
| Claude 4.5 Haiku | Anthropic | 25% |
| Claude Sonnet 4.6 | Anthropic | ~38% |
| Claude 4.5 Sonnet | Anthropic | 48% |
| Gemini 3.1 Pro Preview | 50% | |
| Claude Opus 4.5 | Anthropic | 58% |
| Grok 4 | xAI | 64% |
| Grok 4.1 Fast | xAI | 72% |
| DeepSeek R1 0528 | DeepSeek | 83% |
| Llama 4 Maverick | Meta | 87.6% |
| Gemini 3 Pro Preview | 88% |
Napomena: Ovde se meri koliko često model odgovori netačno kada je zapravo trebalo da odbije da odgovori — proporcija netačnih odgovora od svih odgovora koji nisu korektni. Ovo je suštinski metrika "preteranog samopouzdanja". Izvor: Artificial Analysis AA-Omniscience [2]
Gemini 3 Pro priča najzanimljiviju priču u ovim podacima. On je postigao ubedljivo najveću tačnost (55,9%) u davanju odgovora — taj model zna više stvari od bilo kog drugog testiranog modela na tržištu. Ipak, pokazao je i stopu halucinacija od jezivih 88%. Kada ne zna odgovor, u 88% slučajeva će izmisliti podatak radije nego da prizna nesigurnost. [2]
Veliko znanje + nizak nivo samosvesti = model koji je briljantan kada je u pravu, a izuzetno opasan kada greši.
Ažuriranje na Gemini 3.1 Pro delimično je rešilo ovaj problem. Google-ovo kalibracijsko fino podešavanje uspelo je da smanji halucinacije sa 88% na 50%, a da pritom zadrži gotovo identičnu tačnost u znanju (55,3% nasuprot 55,9%). Omniscience Indeks je skočio sa 16 na 33 — najviši od svih modela. Ovo je dokazalo da je dramatično smanjenje halucinacija zapravo moguće bez žrtvovanja sposobnosti samog modela. [15]
Nijedan pojedinačni model ne dominira u svim oblastima znanja:
| Domen | Najbolji model |
|---|---|
| Pravo | Claude 4.1 Opus |
| Softversko inženjerstvo | Claude 4.1 Opus |
| Humanističke i društvene nauke | Claude 4.1 Opus |
| Biznis | GPT-5.1.1 |
| Zdravstvo | Grok 4 |
| Nauka i matematika | Grok 4 |
Izvor: Artificial Analysis AA-Omniscience [2]
Claude modeli vode u domenima gde su precizno rezonovanje i tačnost citiranja ključni. Grok vodi u domenima gde široka pokrivenost znanja igra presudnu ulogu. GPT vodi u poslovnim aplikacijama. Ova fragmentacija je sama po sebi podatak — znači da nijedan model nije najbezbedniji izbor za svaki profesionalni scenario korišćenja.
Tačnost korelira sa veličinom samog modela. Stopa halucinacija ne.
Veći modeli znaju više stvari, ali ne znaju nužno šta to zapravo ne znaju. Zato se problem halucinacija neće jednostavno sam rešiti bacanjem veće procesorske snage ili izbacivanjem "sledeće generacije" jezičkih modela.
FACTS benčmark, objavljen u decembru 2025. godine, deli tačnost informacija na četiri jasne dimenzije. Ovo nam omogućava da tačno vidimo gde je svaki model jak, a gde podbacuje. [3]
Utemeljenost u podacima (Grounding): Da li model može dosledno da koristi informacije iz priloženih dokumenata? (Testira se kroz zadatke sažimanja i ekstrakcije podataka sa izvornim materijalom).
Multimodalnost: Da li model može tačno da opiše i rezonuje o vizuelnom sadržaju u kombinaciji sa tekstom?
Parametarsko znanje: Da li interno znanje modela (ono koje je uskladišteno u njegovim "težinama" iz treninga) daje tačne odgovore bez korišćenja eksternih alata?
Pretraga: Koliko je model tačan kada ima pristup alatima za veb-pretragu?
| Model | Ukupno | Utemeljenost | Multimodalnost | Parametarski | Pretraga |
|---|---|---|---|---|---|
| Gemini 3 Pro | 68.8 | 69.0 | 46.1 | 76.4 | 83.8 |
| Gemini 2.5 Pro | 62.1 | – | – | – | – |
| GPT-5 | 61.8 | – | – | – | 77.7 |
| Grok 4 | 53.6 | – | – | – | 75.3 |
| GPT o3 | 52.0 | 36.2 | – | 57.1 | – |
| Claude 4.5 Opus | 51.3 | – | – | – | – |
| GPT 4.1 | 50.5 | – | – | – | – |
| Gemini 2.5 Flash | 50.4 | – | – | – | – |
| GPT 5.1 | 49.4 | – | – | – | – |
| Claude 4.5 Sonnet Thinking | 49.1 | – | – | – | – |
| Claude 4.1 Opus | 46.5 | – | – | – | – |
| GPT 5 mini | 45.9 | – | – | – | – |
| Claude 4 Sonnet | 42.8 | – | – | – | – |
| GPT o4 mini | 37.6 | – | – | – | – |
| Grok 4 Fast | 36.0 | – | – | – | – |
Napomena: Crtice označavaju da rezultati za te specifične segmente nisu objavljeni. Ukupan FACTS rezultat je prosek sve četiri dimenzije. Izvor: FACTS Benchmark Suite, Decembar 2025 [3]
Nijedan model ne prelazi 70%. Najbolji rezultat na FACTS testu drži Gemini 3 Pro sa 68,8. Svaki model na tržištu greši u više od 30% slučajeva na ovoj višedimenzionalnoj evaluaciji tačnosti.
Pretraga je najjači adut kod svih. Gemini 3 Pro dostiže 83,8, a GPT-5 dostiže 77,7 u tačnosti kada koriste pretragu. Kada modeli mogu nešto da potraže na vebu, postaju značajno tačniji. Kada se oslanjaju isključivo na uskladišteno znanje, tačnost pada. Ovo se poklapa sa nalazima iz OpenAI sistemskih kartica o uticaju pristupa pretrazi.
Grok 4 ima unutrašnji jaz od 50 poena. Ostvaruje 75,3 u pretrazi, ali samo 25,7 u multimodalnosti — ogromna nedoslednost koja znači da odlično pronalazi činjenice, ali se izuzetno loše snalazi sa vizuelnim sadržajem. Zbirna ocena uspešno maskira ovu drastičnu razliku.
Poboljšanje Gemini 3 Pro je stvarno. U poređenju sa Gemini 2.5 Pro, Gemini 3 Pro je smanjio stope grešaka za 55% u segmentu pretrage i za 35% u parametarskom segmentu. To je veliko generacijsko poboljšanje činjenične tačnosti, pokrenuto prvenstveno boljim mogućnostima pretrage i utemeljenosti u podacima.
Svaki od modela u nastavku profilisan je na osnovu više benčmark testova. Oslanjanje na samo jedan test daje pogrešnu sliku — ovi profili tačno pokazuju gde je koji model pouzdan, a gde nije.

Profili vodećih modela kroz 5 dimenzija halucinacija. Izvori: Vectara [1], AA-Omniscience [2], FACTS [3], SimpleQA [4]
GPT-5.3 Instant (Mart 2026) — Najnoviji model kompanije OpenAI. Smanjuje halucinacije za 26,8% sa uključenom veb-pretragom (i za 19,7% bez nje), u poređenju sa prethodnim modelima. [10]
GPT-5.2 (Decembar 2025) — Pouzdan model za poslovnu primenu. AA-Omniscience tačnost: 43,8%. Sa veb-pretragom nudi 93,9% odgovora bez greške. Bez pretrage: stopa greške skače na 12%. HalluHard: 38,2% sa vebom. FACTS ukupno: 61,8. [9]
GPT-5 (Avgust 2025) — Na starom Vectara setu: sjajnih 1,4%. Na novom: loših >10%. Ipak, u medicinskom HealthBench testu uz uključeno rezonovanje ostvario je 1,6% — jedan od najboljih rezultata zabeleženih u medicini. SimpleQA bez veba: 47%. Sa vebom: 9,6%. FACTS ukupno: 61,8. [8][12]
Obrazac kod GPT-5: Pristup veb-pretrazi je najveća varijabla. Sa uključenom pretragom, GPT-5 modeli se bore za titulu modela sa najmanje halucinacija u industriji. Bez nje, stope halucinacija skaču 3 do 5 puta. Ako implementirate GPT-5, ostavite mu uključen pristup internetu.
Claude 4.1 Opus — AA-Omniscience stopa halucinacija: 0%. Apsolutno najniža stopa od svih testiranih modela. Ovo je postigao tako što odbija da odgovori kada je nesiguran. FACTS: 46,5. Lider u domenu prava, softverskog inženjeringa i humanističkih nauka. [2]
Claude Opus 4.6 (Februar 2026) — Tačnost na AA-Omniscience: 46,4%, indeks: 14. Na novom Vectara setu (februar 2026): 12,2%. Treći najviši Omniscience Indeks van Gemini porodice. [14][2]
Claude Opus 4.5 (Novembar 2025) — AA-Omniscience halucinacije: 58%, tačnost: 45,7%. HalluHard: 30% sa veb-pretragom (najniže od svih modela), ali 60% bez nje. FACTS: 51,3. [5]
Claude Sonnet 4.6 (Februar 2026) — Stopa halucinacija pala je na ~38% (sa 48% koliko je imao Sonnet 4.5). Korisnici su u 59% slučajeva radije birali Sonnet 4.6 nego Opus 4.5, navodeći manji broj halucinacija kao glavni razlog. Vectara novi set: 10,6%. [13][50]
Obrazac kod Claude-a: Anthropic modeli su kalibrisani da odbiju odgovor radije nego da nagađaju. To im daje najniže stope halucinacija na testovima znanja (AA-Omniscience), ali i nižu sirovu tačnost u poređenju sa Gemini-jem. Za aplikacije gde je pogrešan odgovor gori od nikakvog odgovora — pravna istraživanja, medicinske konsultacije, usklađenost sa propisima — Claude-ov pristup je suštinski bezbedniji.
Gemini 3.1 Pro Preview (Februar 2026) — Indeks znanja 33 (najviši od svih). Tačnost: 55,3%. Stopa halucinacija: 50%, što je dramatičan pad u odnosu na 88% kod prethodnika Gemini 3 Pro. Ovo je najveće poboljšanje u jednom ažuriranju tokom 2025-2026. Vectara novi set: 10,4%. [15]
Gemini 3 Pro — Najviši ukupan FACTS rezultat (68,8). FACTS Pretraga: 83,8. FACTS Parametarski: 76,4. AA-Omniscience tačnost: 55,9% (najviša), ali uz užasavajućih 88% halucinacija. To je takozvani Gemini paradoks: model koji najviše zna, a ima najmanje samosvesti. [3]
Gemini 3 Flash (Decembar 2025) — Model apsolutnih ekstrema. AA-Omniscience tačnost: 54,0% (najviša po lansiranju). Stopa halucinacija: 91%. Brzina: 218 tokena u sekundi. Najekstremnija verzija Gemini paradoksa — briljantan i nepouzdan u jednakoj meri. Prikladan isključivo za zadatke gde već imate eksternu verifikaciju. [16]
Obrazac kod Gemini-ja: Google-ovi modeli znaju najviše, ali priznaju najmanje. Pokušavaju da odgovore na sve, što im daje vrhunske rezultate u tačnosti znanja, ali donosi katastrofalne nivoe halucinacija čim naiđu na ivice sopstvenog znanja. Ažuriranje 3.1 Pro je pokazalo da se ovo može rešiti kalibracijom — halucinacije su pale za 38 procentnih poena uz gubitak tačnosti od samo 1%.
Grok 4 — Vectara stari set: 4,8%. AA-Omniscience: 41,4% tačnost, 64% halucinacija, pozitivan indeks. FACTS: 53,6 (Pretraga: 75,3, Multimodalnost: 25,7). Lider u domenima zdravstva i nauke na AA-Omniscience. [2]
Grok 4.1 Fast — xAI tvrdi da su smanjili halucinacije za 65% na internim testovima (sa 12,09% na 4,22%). Međutim, nezavisni AA-Omniscience test govori drugačiju priču: stopa halucinacija je 72%, što je gore od 64% kod bazičnog Grok 4. Povećana je i ulizivačka priroda modela (MASK benčmark: sa 0,07 na 0,19-0,23). [17]
Grok-3 — Columbia Journalism Review: ostvario frapantnih 94% halucinacija pri citiranju. Ubedljivo najgori rezultat na ovom benčmarku. [6]
Obrazac kod Grok-a: Interni rezultati kompanije i nezavisni testovi se oštro razilaze. xAI prijavljuje poboljšanja; AA-Omniscience pokazuje regresiju. Stopa od 94% halucinacija pri citiranju na CJR testu nije od starijeg modela — Grok-3 je testiran u martu 2025. Iako ima vrednost u zdravstvu i nauci, prevelika nedoslednost ga čini rizičnim kao jedini oslonac u bilo kom visokorizičnom okruženju.
Sonar Reasoning Pro — Deli 1. mesto na Search Arena testu sa Gemini 2.5 Pro (skor: 1136). SimpleQA F-skor: 0,858 (najviši u trenutku testiranja). CJR tačnost citiranja: 37% halucinacija (najbolji testiran). Tačnost odgovora: >90% za faktičke upite (94% ukupno, 95% akademski, 94% tehnički). [18][19]
Sonar Pro — Izgrađen na Llama 3.3 70B, fino podešen za tačnost pretrage. SimpleQA F-skor: 0,858. Nadmašuje GPT-4o i Claude 3.5 Sonnet na benčmarkovima tačnosti. [19]
Rizik kod Perplexity-ja: Perplexity uvodi jedan vrlo specifičan problem koji drugi modeli nemaju. On citira prave URL-ove, ali za njih vezuje izmišljene tvrdnje. Izvori izgledaju potpuno legitimno — prava imena portala, pravi linkovi — ali informacije pripisane tim izvorima mogu biti halucinirane. Ovo čini Perplexity halucinacije težim za otkrivanje od halucinacija modela koji ne predstavljaju eksterne citate. Stopa od 37% na citatima znači da više od svakog trećeg citata može sadržati izmišljen sadržaj. [51]
DeepSeek-V3 — Sjajnih 3,9% na starom Vectara setu podataka. Odličan za sažimanje zasnovano na izvorima.
DeepSeek-R1 — Osvojio 14,3% na starom Vectara setu (skoro 4 puta više od V3). AA-Omniscience halucinacije: 83%. Vectara analiza je utvrdila da R1 proizvodi 71,7% "benignih halucinacija" (dodataka koji zvuče uverljivo) nasuprot 36,8% kod V3. [49][48]
Obrazac: DeepSeek-ov "reasoning" model (R1) halucinira dramatično više od svog osnovnog modela (V3). Ovo je porez na rezonovanje u svom najekstremnijem obliku. Razlika (3,9% nasuprot 14,3%) predstavlja jedan od najjasnijih dokaza da napredno razmišljanje modela ne ide nužno ruku pod ruku sa činjeničnom pouzdanošću.
Llama 4 Maverick (Meta) — Vectara stari set: 4,6% (konkurentan rezultat). AA-Omniscience halucinacije: 87,6% (katastrofalno). Razlika između sažimanja zasnovanog na izvorima i otvorenog znanja je veća kod modela otvorenog koda nego kod bilo koje vlasničke porodice modela. [2]
Modeli otvorenog koda su premašili 80% stope halucinacija u medicinskim scenarijima na MedRxiv testiranju. Za kritične aplikacije, razlika u halucinacijama između modela otvorenog koda i vlasničkih frontier modela ostaje velika. [40]
Profili modela iz Sekcije 6 prikazuju individualne performanse. Ova sekcija odgovara na pitanja koja ljudi zapravo pretražuju: "Da li je Claude ili GPT tačniji?" "Da li da koristim Gemini ili Claude?" Odgovor je uvek "zavisi od toga šta radite" — ali podaci čine kompromise konkretnim.

Poređenje "glava u glavu" toplotna mapa: koji provajder pobeđuje na kom benčmarku. Zeleno = pobednik, žuto = nerešeno, crveno = gubitnik.
Ovo je najtraženije poređenje u AI svetu, a ujedno i ono koje najviše zavisi od konteksta.
| Benčmark | Claude | GPT | Pobednik |
|---|---|---|---|
| Vectara (stari set) | 4.4% (Sonnet 3.7) | 1.4% (GPT-5) | GPT |
| Vectara (novi set, Feb 2026) | 10.6% (Sonnet 4.6) | 10.8% (GPT-5.2-high) | Nerešeno |
| AA-Omniscience (Halucinacije) | 0% (Claude 4.1 Opus) | ~78% (GPT-5.2) | Claude |
| AA-Omniscience (Tačnost) | 46.4% (Opus 4.6) | 43.8% (GPT-5.2) | Claude (blago) |
| FACTS Ukupno | 51.3 (Opus 4.5) | 61.8 (GPT-5) | GPT |
| HealthBench | – | 1.6% (GPT-5 thinking) | GPT |
| HalluHard (with web) | 30% (Opus 4.5) | 38.2% (GPT-5.2) | Claude |
Izvori: HealthBench [52], HalluHard [5], FACTS [3], Vectara [1], AA-Omniscience [2]
Obrazac nije "jedan je bolji." Radi se o dve različite filozofije merene na različitim skalama.
GPT modeli su jači kada zadatak ima izvorni materijal za rad. Sažimanje, analiza dokumenata, RAG sistemi, Q&A zasnovano na pretrazi — GPT se drži bliže dostavljenom tekstu i postiže dobre rezultate na testovima doslednosti. Prednost na FACTS-u (61,8 nasuprot 51,3) to odražava: GPT-5 obrađuje zadatke utemeljenosti i pretrage sa većom tačnošću.
Claude modeli su jači kada zadatak zahteva da model poznaje sopstvena ograničenja. Na AA-Omniscience, Claude 4.1 Opus je postigao stopu halucinacija od 0% odbijajući da odgovori na pitanja koja nije mogao da verifikuje. Claude Sonnet 4.6 sa ~38% halucinacija ima manje od polovine stope GPT-5.2 (~78%) na istom benčmarku. Na HalluHard testu realističnih razgovora, Claude Opus 4.5 sa veb-pretragom je postigao 30% — najniže od svih testiranih modela.
Praktična podela uloga: Koristite GPT za RAG sisteme, analizu dokumenata i rad sa tekstom gde je izvorni materijal obezbeđen. Koristite Claude za savetodavne procese, gde model mora da se osloni na svoje znanje, ali i da ume da prepozna kada nešto ne zna. Ovo nije pitanje preference brenda — ovo je ono što podaci iz benčmarkova podržavaju.
Još jedna varijabla koja se često previđa: pristup veb-pretrazi dramatično menja performanse GPT-a. GPT-5 pada sa 47% halucinacija na 9,6% sa uključenom pretragom. Bez pristupa vebu, poređenje Claude-GPT se pomera u korist Claude-a na otvorenim činjeničnim zadacima. Sa pristupom vebu, GPT preuzima vođstvo.
| Benčmark | Claude | Gemini | Pobednik |
|---|---|---|---|
| AA-Omniscience Indeks | 14 (Opus 4.6) | 33 (3.1 Pro) | Gemini |
| AA-Omniscience (Tačnost) | 46.4% (Opus 4.6) | 55.3% (3.1 Pro) | Gemini |
| AA-Omniscience (Halucinacije) | 0% (Claude 4.1 Opus) | 50% (3.1 Pro) | Claude |
| FACTS Ukupno | 51.3 (Opus 4.5) | 68.8 (3 Pro) | Gemini |
| Vectara (stari set) | 4.4% (Sonnet 3.7) | 0.7% (2.0-Flash) | Gemini |
| Vectara (novi set, Feb 2026) | 10.6% (Sonnet 4.6) | 10.4% (3.1 Pro) | Nerešeno |
| HalluHard (sa vebom) | 30% (Opus 4.5) | – | Claude |
Izvori: HalluHard [5], FACTS [3], Vectara [1], AA-Omniscience [2]
Gemini zna više. Claude je iskreniji u pogledu onoga što ne zna.
Gemini 3.1 Pro vodi na gotovo svakoj metrici tačnosti. Ima najviši FACTS rezultat (68,8), najvišu AA-Omniscience tačnost (55,3%) i drži vrhunski Omniscience Indeks (33). Kada Gemini ima odgovor, isporučuje ga češće nego Claude.
Problem nastaje kada nema odgovor. Čak i nakon kalibracijskog ažuriranja 3.1 koje je smanjilo halucinacije sa 88% na 50%, Gemini i dalje izmišlja odgovor u polovini slučajeva kada bi trebalo da kaže "Ne znam." Claude 4.1 Opus izmišlja u 0% slučajeva u tom scenariju.
Praktična podela uloga: Gemini za zadatke koji zahtevaju širinu znanja gde postoji mogućnost eksterne provere — istraživanja, komparativne analize, prikupljanje informacija. Claude za zadatke gde je poverenje ključno i gde vas pogrešan odgovor može skupo koštati — pregled ugovora, pravna istraživanja, medicinske konsultacije. Ako možete da proverite Gemini-jev rad, koristite Gemini. Ako ne možete, koristite Claude.
| Benčmark | GPT | Gemini | Pobednik |
|---|---|---|---|
| Vectara (stari set) | 0.8% (o3-mini) | 0.7% (2.0-Flash) | Nerešeno |
| Vectara (novi set) | 5.6% (GPT-4.1) | 3.3% (2.5-Flash-Lite) | Gemini |
| FACTS Ukupno | 61.8 (GPT-5) | 68.8 (3 Pro) | Gemini |
| FACTS Pretraga | 77.7 (GPT-5) | 83.8 (3 Pro) | Gemini |
| AA-Omniscience (Tačnost) | 43.8% (GPT-5.2) | 55.3% (3.1 Pro) | Gemini |
| HealthBench | 1.6% (GPT-5 thinking) | – | GPT |
Izvori: FACTS [3], Vectara [1], AA-Omniscience [2]
Gemini vodi na većini benčmarkova. Prednost GPT-a je specifična za zadatak: medicinske aplikacije (1,6% HealthBench), tačnost na nivou tvrdnji u produkciji sa thinking modom (4,5% netačnih tvrdnji) i sam obim internih podataka o evaluaciji koje OpenAI objavljuje.
Praktična podela uloga: Oba modela su moćna kada imaju pristup alatima i internetu. Bez toga, Gemini ima blagu prednost u "parametarskom" znanju (FACTS Parametarski: 76,4) na zadacima uskladištenog znanja. GPT briljira u medicini zahvaljujući thinking modu koji tu drastično spušta stopu halucinacija.
| Benčmark | Grok | Prosek polja |
|---|---|---|
| xAI interna tačnost | 4.22% (Grok 4.1) | – |
| AA-Omniscience | 64% halucinacija (Grok 4) | ~60% prosek |
| AA-Omniscience (Fast varijanta) | 72% halucinacija (Grok 4.1 Fast) | Gore od bazičnog |
| FACTS Ukupno | 53.6 (Grok 4) | ~52 prosek |
| FACTS Pretraga | 75.3 (Grok 4) | Konkurentan |
| FACTS Multimodalnost | 25.7 (Grok 4) | Daleko ispod proseka |
| CJR Citati | 94% halucinacija (Grok-3) | Najgori testiran |
| Vectara (novi set) | 20.2% (Grok-4-fast) | Najgori testiran |
Izvori: Grok 4.1 [17], CJR [6], FACTS [3], AA-Omniscience [2]
xAI prijavljuje smanjenje halucinacija od 65% sa Grok 4 na 4.1 na internim testovima. AA-Omniscience pokazuje suprotno: Grok 4.1 Fast halucinira 72% nasuprot 64% kod Grok 4. CJR studija citiranja je utvrdila da Grok-3 halucinira 94% vremena pri pripisivanju novinskih izvora.
Grok zaista ima autentične prednosti u specifičnim domenima — vodi kategorije zdravstva i nauke na AA-Omniscience. Ali razlika između tvrdnji xAI-a i nezavisnih merenja je veća nego kod bilo kog drugog provajdera.
Praktičan savet: Ne koristite Grok kao jedini model za visokorizične odluke. Njegova vrednost je kao jedan glas u multi-model evaluaciji gde njegove prednosti u specifičnim domenima (zdravstvo, nauka) mogu doprineti, dok druge modele koristite da uhvatite njegove nedoslednosti.
| Benčmark | Perplexity | ChatGPT | Claude |
|---|---|---|---|
| CJR Tačnost citiranja | 37% halucinacija | 67% halucinacija | – |
| SimpleQA F-skor | 0.858 (najbolji) | 0.38 (GPT-4o) | 0.35 (Sonnet 3.5) |
| Search Arena Rang | #1 (nerešeno) | – | – |
| Tačnost odgovora | >90% činjenična | – | – |
Izvori: Perplexity Sonar [18][19], CJR [6]
Perplexity pobeđuje na činjeničnim upitima pretrage. Njegova RAG-nativna arhitektura, izgrađena oko pretraživanja umesto parametarskog znanja, daje mu strukturnu prednost za pitanja sa proverljivim odgovorima.
Kvaka: Perplexity citira prave URL-ove sa izmišljenim tvrdnjama. Izvori izgledaju legitimno — pravi veb-sajtovi, prava imena publikacija — ali informacije pripisane tim izvorima mogu biti izmišljene. Sa stopom od 37% halucinacija pri citiranju, više od svakog trećeg pripisivanja izvoru može sadržati izmišljen sadržaj. Ovo čini Perplexity halucinacije težim za uočavanje od halucinacija modela koji ne predstavljaju eksterne citate.
Praktična podela uloga: Perplexity za početno istraživanje i pronalaženje činjenica gde ćete verifikovati ključne tvrdnje. Ne za scenarije konačnog odgovora gde neko čita citirani izvor i pretpostavlja da je pripisivanje tačno.
Model koji je odličan za opšte znanje može biti opasno netačan kada mu postavite pravno pitanje. Stope halucinacija drastično variraju po oblastima. Ova tabela prikazuje raspon kroz osam domena znanja:
| Domen / Industrija | Top modeli | Prosek svih modela |
|---|---|---|
| Opšte znanje | 0.8% | 9.2% |
| Istorijske činjenice | 1.7% | 11.3% |
| Finansijski podaci | 2.1% | 13.8% |
| Tehnička dokumentacija | 2.9% | 12.4% |
| Naučna istraživanja | 3.7% | 16.9% |
| Medicina / Zdravstvo | 4.3% | 15.6% |
| Programiranje / Kodiranje | 5.2% | 17.8% |
| Pravne informacije | 6.4% | 18.7% |
Izvor: AllAboutAI, 2025 [31]

Stope halucinacija specifične za domen: top modeli nasuprot proseku. Trostruka razlika u pravu i programiranju pokazuje koliko odabir modela utiče. Izvor: AllAboutAI [31]
Obratite pažnju na ogromnu razliku: u pravnim pitanjima najbolji modeli greše u 6,4% slučajeva, dok prosečni modeli promašuju u neverovatnih 18,7%. Odabir pravog modela nije samo tehnička stvar — to je doslovno razlika od 300% u pouzdanosti.
Slučajevi u kojima je AI izmišljao zakone i presude samo rastu uprkos rastućoj svesti o problemu.
Sudski predmeti koji uključuju AI halucinacije porasli su sa 10 dokumentovanih presuda u 2023. na 37 u 2024. na 73 u samo prvih pet meseci 2025. godine, sa 50+ slučajeva samo u julu 2025. Pravni istraživač Damien Charlotin dokumentovao je 120+ slučajeva u kojima su sudovi pronašli halucinirane citate, izmišljene reference na predmete ili inventovane pravne presedane. [38][37]

Pravni AI incidenti halucinacija: ubrzanje od 10 → 37 → 73 → 50+ slučajeva. Izvori: Business Insider [38], Charlotin [37]
Problem više nije amaterski. U 2023. godini, većina slučajeva halucinacija uključivala je stranke bez advokata. Do maja 2025., 13 od 23 uhvaćena slučaja bila su od praktikovajućih advokata. Morgan & Morgan, jedna od najvećih američkih advokatskih firmi, poslala je hitno upozorenje 1.000+ advokata nakon pretnji sankcijama zbog citatā koje je generisao AI. Sudovi su u više navrata izricali novčane kazne koje premašuju 10.000 dolara, u najmanje pet slučajeva, četiri od njih u 2025.
Benčmark podaci objašnjavaju zašto. Stanford RegLab i Stanford Institut za AI usmerenu ka čoveku utvrdili su da LLM modeli haluciniraju između 69% i 88% na specifičnim pravnim upitima. Na pitanja o suštini sudske presude, modeli haluciniraju najmanje 75% vremena. Čak i specijalizovani pravni AI alati podbacuju: Lexis+ AI je davao netačne informacije u više od 17% slučajeva, a Westlaw AI-Assisted Research halucinirao je u preko 34%. [36]
Globalna organizacija za bezbednost u zdravstvu, ECRI, navela je AI rizike kao tehnološku pretnju broj 1 za 2025. godinu. Brojke potvrđuju zabrinutost. [39]
FDA je odobrio 1.357 medicinskih uređaja poboljšanih veštačkom inteligencijom — dvostruko više u odnosu na kraj 2022. Od toga, 60 uređaja je bilo uključeno u 182 povlačenja sa tržišta, pri čemu se 43% povlačenja desilo u prvoj godini odobrenja. [42]
Studija MedRxiv iz 2025. merila je stope halucinacija na sažecima kliničkih slučajeva: 64,1% bez tehnika ublažavanja, pad na 43,1% sa ublažavanjem (poboljšanje od 33%). GPT-4o je postigao najbolji rezultat u ovoj studiji, padajući sa 53% na 23% sa strukturiranim ublažavanjem. Modeli otvorenog koda su premašili 80% halucinacija u medicinskim scenarijima. [40]
Ipak, ima i dobrih vesti: GPT-5 sa uključenim thinking modom postigao je 1,6% halucinacija na HealthBench testu, u poređenju sa 15,8% kod GPT-4o. Za medicinske aplikacije specifično, frontier modeli sa uključenim modom za rezonovanje pokazuju dramatično poboljšanje u odnosu na prethodne generacije. [41][52]
Finansijske AI halucinacije ne privlače pažnju medija kao pravne, ali troškovi su veći.
Čak 78% finansijskih institucija sada koristi AI za analizu podataka. Bez zaštitnih mehanizama, stope halucinacija na finansijskim zadacima kreću se od 15-25%. Firme prijavljuju 2,3 značajne greške izazvane AI-jem po kvartalu, sa troškovima pojedinačnih incidenata u rasponu od 50.000 do 2,1 milion dolara. [44]
Benčmark studija je utvrdila da ChatGPT-4o halucinira 20,0% na referencama finansijske literature. Gemini Advanced je halucinirao 76,7% na istom zadatku.
67% VC fondova koristi AI za screening poslova, ali prosečno vreme za otkrivanje greške generisane AI-jem je 3,7 nedelja — često prekasno da se odluka poništi. Halucinacija jednog robo-savetnika uticala je na 2.847 klijentskih portfelja, izazivajući štetu od 3,2 miliona dolara. SEC (Komisija za hartije od vrednosti) izrekla je 12,7 miliona dolara kazni zbog lažnih informacija nastalih usled AI modela tokom 2024-2025. [43]
67,4 milijarde dolara — globalni gubici izazvani AI halucinacijama u 2024. godini. [31]
47% direktora donosilo je važne odluke bazirane na neproverenom AI sadržaju. [32]
82% bagova u produkcionim AI sistemima potiče od halucinacija i grešaka u tačnosti. [34]
4,3 sata nedeljno — prosečan zaposleni provede proveravajući šta je AI napisao. To poslodavca košta u proseku 14.200 dolara godišnje po zaposlenom. [33][31]
39% chatbota u korisničkoj podršci moralo je da bude prepravljeno upravo zbog halucinacija. [34]
54% kompanija je iskusilo pad poverenja investitora direktno uzrokovan greškama koje je generisala veštačka inteligencija.
91% korporativnih AI politika sada uključuje protokole specifične za halucinacije. [31]
64% zdravstvenih organizacija je odložilo usvajanje AI-a konkretno zbog zabrinutosti oko halucinacija. [31]
12,8 milijardi dolara investirano je u rešenja za detekciju i ublažavanje halucinacija između 2023. i 2025. godine. [31]
318% rasta tržišta alata za detekciju halucinacija od 2023. do 2025. [35]
Preko 53 naučna rada prihvaćena na NeurIPS 2025 — jednoj od najprestižnijih svetskih AI konferencija — sadržala su citate koje je halucinirala veštačka inteligencija, a koji su prošli rigorozne procese recenzije. Stopa prihvatanja na NeurIPS-u iznosi 24,52%, što znači da su ovi halucinirani radovi pobedili 15.000+ konkurentskih prijava. [45]
Kada lažni citati prođu ekspertsku proveru na najznačajnijem mestu u industriji, problem više nije samo u biznisu, već u samom temelju AI istraživanja.
Pogledajte kako multi-model validacija funkcioniše u praksi.
Zatražite demonstracijuNajkontraintuitivnije otkriće istraživanja iz 2025-2026. godine: modeli koji se reklamiraju kao "najpametniji", često su najnepouzdaniji kada su u pitanju osnovne činjenice.
Modeli za rezonovanje — GPT-5 thinking, Claude extended thinking, DeepSeek-R1 — koriste tok misli (chain-of-thought) koji drastično unapređuje rešavanje složenih problema. Odlični su za matematiku, logiku, višestepenu analizu i medicinsku dijagnostiku.
Ali, osetno su lošiji u držanju za činjenice koje su im date.
Vectara novi set podataka: Svaki testirani reasoning model premašio je 10% halucinacija. GPT-5, Claude Sonnet 4.5, Grok-4 i Gemini-3-Pro su svi prešli taj prag. Grok-4-fast-reasoning varijanta dostigla je 20,2%. Modeli bez rezonovanja poput Gemini-2.5-Flash-Lite ostvarili su 3,3%. [1]
DeepSeek: R1 (reasoning) halucinira na 14,3% na Vectara testu naspram V3 (bazni model) na 3,9%. Skoro četvorostruka razlika od istog provajdera. Vectara analiza je pokazala da R1 proizvodi 71,7% "benignih halucinacija" (uverljivo zvučeći dodaci) u poređenju sa 36,8% kod V3. [48][49]
PersonQA regresija: OpenAI-ev o3 halucinira na 33% kod pitanja o stvarnim ljudima naspram 16% kod o1. Model o4-mini je još gori sa 48%. Noviji, sposobniji modeli postižu lošije rezultate na bazičnom činjeničnom testu. [53][54]
GPT-5 thinking mod: HealthBench halucinacije padaju na 1,6% (odlično). Ali na Vectara novom setu podataka, GPT-5 prelazi 10% (loše). Isti model, isti thinking mod, suprotni rezultati u zavisnosti od zadatka.
Mehanizam je jednostavan. Kada modelu koji "rezonuje" date zadatak da sažme tekst, on ne radi samo ekstrakciju podataka — on razmišlja. Pokušava da izvuče zaključke, poveže tačke i doda uvide. Sve te korisne dodatke benčmark za sažimanje teksta označava isključivo kao halucinaciju, jer te informacije nisu bile prisutne u originalnom tekstu.
To je razlika između "sažmi ovaj ugovor" i "analiziraj ovaj ugovor". Reasoning mod dodaje analizu čak i kada tražite sažetak. Ta analiza je često korisna. Na benčmarku za sažimanje, računa se kao greška.
Sistemske kartice kompanije OpenAI otkrivaju nešto što se često previđa: pristup internet pretrazi utiče na smanjenje halucinacija znatno više nego samo aktiviranje reasoning moda. [11][8]
| Model | Pretraga ISKLJUČENA | Pretraga UKLJUČENA | Smanjenje |
|---|---|---|---|
| o4-mini FActScore | 37.7% | 5.1% | 86% |
| o3 FActScore | 24.2% | 5.7% | 76% |
| GPT-5 thinking FActScore | 3.7% | 1.0% | 73% |
| GPT-5 SimpleQA | 47% | 9.6% | 80% |
Izvori: o3/o4-mini sistemska kartica [11], GPT-5 sistemska kartica [8]

Efekat veb-pretrage: 73-86% smanjenje halucinacija jednim konfiguracijskim prekidačem. Izvori: OpenAI sistemske kartice [8][11][10]
Uključivanje veb-pretrage smanjuje halucinacije više nego uključivanje rezonovanja. Za poslovne implementacije, obezbeđivanje pristupa alatima ima veći uticaj od odabira reasoning naspram ne-reasoning varijanti modela.
Ovo stvara praktičnu matricu za odabir modela:
Rezonovanje UKLJUČENO + Veb UKLJUČEN: Najbolje za kompleksne analize, medicinsku dijagnozu i višestepena istraživanja gde su dubina i pristup aktuelnim informacijama bitni. Najniže stope halucinacija na otvorenim zadacima.
Rezonovanje ISKLJUČENO + Veb UKLJUČEN: Najbolje za sažimanje dokumenata, RAG sisteme i Q&A zasnovano na izvorima gde želite da se model drži izvornog materijala. Manji rizik od "prekomerne analize".
Rezonovanje UKLJUČENO + Veb ISKLJUČEN: Visok rizik. Model "previše razmišlja", a nema način da te tvrdnje proveri. Prikladno samo za zatvorene logičke probleme, matematiku i kod gde eksterni podaci nisu potrebni.
Rezonovanje ISKLJUČENO + Veb ISKLJUČEN: Najviši rizik od halucinacija u svim kategorijama. Apsolutno izbegavati za zadatke zasnovane na činjenicama.
Ovo nije nagađanje. Dva nezavisna istraživačka tima su to i dokazala.
Istraživači (Xu et al., 2024) su matematički formalizovali problem halucinacija i dokazali da je potpuno eliminisanje halucinacija u velikim jezičkim modelima (LLM) — nemoguće. Ne "teško". Ne "nešto što zahteva više računarske moći ili bolje podatke za trening". Nemoguće — i to matematički dokazivo, s obzirom na fundamentalnu arhitekturu načina na koji ovi sistemi generišu tekst. [20]
Suština argumenta: Svaki sistem koji generiše tekst tako što predviđa verovatne sekvence iz naučenih statističkih distribucija će, po matematičkoj nužnosti, ponekad proizvesti ispise koji nisu utemeljeni u činjenicama. Sam generativni mehanizam to garantuje.
Istraživač Karpowicz (2025) pristupio je problemu kroz tri različita matematička okvira — teoriju aukcija, teoriju pravilnog bodovanja i analizu za transformer arhitekture — i svaki put došao do istog zaključka. [21]
Nijedan mehanizam LLM inferencije ne može istovremeno ispuniti sva četiri sledeća svojstva:
Možete optimizovati sistem za bilo koja tri cilja, ali nikada ne možete dobiti sva četiri. Matematika to ne dozvoljava.
Kompanija OpenAI je javno priznala ove nalaze i identifikovala tri matematička faktora koja čine halucinacije neizbežnim: [22]
Epistemička nesigurnost — kada se informacija retko pojavljuje u podacima za treniranje, model nema pouzdanu osnovu za generisanje tačnog ispisa o toj temi, ali će ipak pokušati.
Ograničenja modela — neki zadaci premašuju ono što arhitektura uopšte može da predstavi, bez obzira na obim ili kvalitet podataka za trening.
Računarska kompleksnost — određeni problemi verifikacije su računarski toliko zahtevni da ih ni teoretski superinteligentan sistem ne bi mogao rešiti u razumnom vremenu.
Halucinacija nije "bag" koji će biti ispravljen u narednoj verziji modela. To je trajno, matematičko svojstvo načina na koji jezički modeli funkcionišu.
Ovo menja suštinu pitanja. Pravo pitanje nije "Koji AI ne halucinira?" — svaki AI halucinira. Pravo pitanje glasi: Kakve sisteme imate na snazi da uhvatite halucinacije pre nego što stignu do osobe koja donosi odluke?
Organizacije koje ovo rade kako treba ne čekaju na model bez halucinacija. One grade slojeve za detekciju, cross-validation sisteme i kontrolne tačke za ljudsku reviziju. Podaci o tome šta zaista funkcioniše nalaze se u sekciji o tehnikama smanjenja ispod.
Nisu sve tehnike za smanjenje halucinacija iste. Neke su podržane kontrolisanim studijama sa preciznim merenjima, dok druge imaju jako teoretsko uporište, ali ograničene podatke u produkciji. Ovo rangiranje odražava stvarnu bazu dokaza, a ne marketinške tvrdnje.

Tehnike smanjenja halucinacija rangirane prema izmerenom uticaju. Izvori: OpenAI [8][11], AllAboutAI [31], HealthBench [52], UAF [24], CoVe [23], VeriFY [25], Gemini 3.1 [15], MedRxiv [40]
Izmereni uticaj: 73-86% smanjenje halucinacija (FActScore, pretraga uključena vs isključena)
Intervencija sa ubedljivo najvećim uticajem u istraživanjima 2025-2026. GPT-5 pada sa 47% na 9,6% halucinacija kada dobije pristup vebu. Kod modela o4-mini, pad je sa 37,7% na 5,1%. GPT-5.3 Instant pokazuje smanjenje od 26,8% kada koristi veb u poređenju sa prethodnim modelima. [8][11][10]
Logika je jednostavna: umesto da se oslanja na zastarele podatke iz treninga, model povlači trenutne informacije i utemeljuje svoj odgovor na eksternim izvorima. Za svaku poslovnu implementaciju, omogućavanje pristupa vebu ili alatima treba da bude prva konfiguracijska odluka, a ne naknadna misao.
Izmereni uticaj: Do 71% smanjenja na zadacima nad internom bazom znanja kompanije [31]
RAG povezuje modele sa eksternim bazama znanja — dokumenti kompanije, baze podataka, provereni izvori — i navodi model da generiše odgovore utemeljene u tom preuzetom sadržaju, a ne iz parametarske memorije. Hibridni retrieveri koji kombinuju retke i guste metode donose najjaču mitigaciju.
RAG je najefikasniji za halucinacije uzrokovane nedostatkom znanja (model nema relevantne podatke za trening). Manje je efikasan za logičke halucinacije (model pogrešno rezonuje iz ispravnih premisa). Za Q&A nad internim dokumentima i aplikacije nad bazama znanja, RAG je postao apsolutni standard industrije.
Izmereni uticaj: 55-75% smanjenja na složenim medicinskim i činjeničnim zadacima; međutim, povećava halucinacije kod čistog sažimanja teksta [52]
GPT-5 thinking mod: HealthBench pada sa 3,6% na 1,6%. U produkcionom ChatGPT saobraćaju: 4,8% odgovora sadrži ozbiljne netačne tvrdnje naspram 11,6% bez rezonovanja. Ovo su značajna poboljšanja.
Ipak, taj isti mod šteti na Vectara benčmarku za sumarizaciju (videti Sekciju 10). Uticaj je strogo vezan za sam zadatak. Uključite rezonovanje za analize, dijagnostiku i kompleksne upite. Isključite ga za sumarizaciju, ekstrakciju podataka i zadatke gde se traži vernost izvoru.
Izmereni uticaj: 8% poboljšanja u tačnosti u odnosu na pristup sa jednim modelom (UAF okvir) [24]
Amazonov UAF (Uncertainty-Aware Fusion) okvir (objavljen na ACM WWW 2025) kombinuje više LLM-ova ponderisanih prema njihovoj tačnosti i sposobnosti samoprocene. Ključni nalaz: različiti modeli briljiraju na različitim tipovima pitanja, tako da njihovo kombinovanje hvata komplementarne prednosti.
Detekcija neslaganja među modelima hvata halucinacije jer modeli retko izmišljaju iste lažne informacije. Kada jedan model iznese nepotkrepljenu tvrdnju, drugi obično ukazuju na nedoslednost ili pružaju oprečne podatke. Istraživanja o "mudrosti silicijumske mase" pokazuju da AI ansambli mogu parirati tačnosti ljudske grupe pukom agregacijom.
Cifra od 8% potcenjuje praktičnu vrednost. U produkciji, multi-model pristupi hvataju greške koje provera putem samo jednog modela redovno propušta — jer model koji proverava ima različite podatke za trening, različite pristrasnosti i različite slepe tačke.
Izmereni uticaj: 28% poboljšanja u FActScore-u [23]
Ovaj pipeline podrazumeva četiri koraka: generisanje osnovnog odgovora, planiranje pitanja za proveru, nezavisno odgovaranje na ta pitanja, a zatim fino podešavanje finalnog ispisa. Objavljen na ACL 2024, nadmašuje zero-shot, few-shot i chain-of-thought promptovanje u tačnosti generisanja dugih tekstova.
Cena ovoga je veća latencija i utrošak resursa: četiri koraka umesto jednog. Za aplikacije gde je tačnost važnija od brzine — generisanje izveštaja, sinteza istraživanja, dokumentacija usklađenosti — ovaj kompromis se itekako isplati.
Izmereni uticaj: 9,7-53,3% smanjenje halucinacija kroz različite porodice modela [25]
Objavljen na ICML 2025, VeriFY uči modele da procenjuju sopstvenu činjeničnu nesigurnost tokom samog generisanja odgovora, umesto da se oslanjaju na post-generativne provere. Model uči da verifikuje sopstvene tvrdnje dok ih proizvodi. Gubitak u odzivnosti je skroman: 0,4-5,7%.
Ovo je intervencija tokom treniranja, što znači da krajnji korisnici na nju ne utiču. Njena vrednost je u pokazivanju smera u kom ide industrija: buduće generacije modela će verovatno internalizovati verifikaciju kao ključnu sposobnost, umesto da je dodaju naknadno.
Izmereni uticaj: 38 procentnih poena smanjenja AI halucinacija (Gemini 3.1 Pro, sa 88% na 50%) uz gubitak tačnosti od samo 1% [15]
Google je demonstrirao da fino podešavanje kalibracije modela — njegove sposobnosti da uskladi samopouzdanje sa stvarnom tačnošću — može dramatično smanjiti halucinacije bez žrtvovanja znanja. Indeks sveznanja (Omniscience Index) kod Gemini 3.1 Pro skočio je sa 16 na 33 ovim pristupom.
Kao i kod VeriFY, ovo je intervencija na strani provajdera. Korisnici od nje imaju koristi kada biraju novije verzije modela, ali ne mogu je sami primeniti.
Izmereni uticaj: 33% smanjenja na medicinskim zadacima (sa 64,1% na 43,1%); GPT-4o je pao sa 53% na 23% [40]
Strukturirani promptovi koji instrukcijama ograničavaju model na proverene informacije, označavaju nesigurnost i izbegavaju spekulacije. Najbolje funkcionišu u uskim domenima sa jasnim granicama i dobro definisanom terminologijom.
Medicinski rezultati su ohrabrujući, ali apsolutne stope ostaju visoke (43,1% uz mitigaciju je i dalje opasno visoko za kliničku primenu). Domenski promptovi su samo dodatni sloj zaštite, a ne kompletno rešenje.
Samo oslanjanje na "veće modele": Tačnost raste sa veličinom modela, ali ne i samosvest. Veći modeli znaju više, ali ne znaju nužno šta ne znaju.
Prosto smanjenje "Temperature": Smanjenje temperature kod generisanja teksta smanjuje raznolikost, ali ne i halucinacije. Model i dalje bira najverovatniji token — samo što sada doslednije bira onaj pogrešan.
"Budi tačan" u sistemskom promptu: Generičke instrukcije da se "izbegavaju halucinacije" pokazuju minimalan merljiv efekat. Modeli već "pokušavaju" da budu tačni. Problem je na arhitektonskom, a ne motivacionom nivou.
Istraživanja objavljena tokom 2024-2026. godine sve više potvrđuju specifičan nalaz: slanje upita različitim AI modelima za isto pitanje hvata greške koje pristupi sa jednim modelom propuštaju. Ovo nije teoretski argument. Više recenziranih studija pruža izmerene dokaze.
UAF (Uncertainty-Aware Fusion) okvir kombinuje više LLM-ova ponderisanih prema dva faktora: tačnosti svakog modela na zadatku i sposobnosti svakog modela da sam proceni kada je nesiguran. Izmereni rezultat: 8% poboljšanja tačnosti u odnosu na bilo koji pojedinačni model. [24]
Ključni uvid iz studije: "Tačnost LLM-ova i sposobnost samoprocene dramatično variraju, pri čemu različiti modeli briljiraju u različitim scenarijima." Nijedan pojedinačni model ne dominira svim tipovima pitanja. GPT je možda najjači na utemeljenim zadacima, Claude na zadacima kalibracije znanja, Gemini na širini znanja. Ansambl hvata sve tri prednosti.
Modeli trenirani na različitim podacima, sa različitim arhitekturama i različitim podešavanjima, razvijaju različite obrasce grešaka. Kada pet modela analizira isto pitanje, oni retko izmisle istu lažnu informaciju.
Jedan model tvrdi da postoji neki pravni presedan. Ostala četiri ga ne pominju. To neslaganje je ključni signal. Ljudski recenzent može da istraži konkretnu tvrdnju umesto da pregleda celokupan izlaz.
Ovo funkcioniše jer su halucinacije stohastičke, a ne sistematske. Model ne halucinira dosledno istu netačnu činjenicu — popunjava praznine različitim, uverljivim sadržajem svaki put iznova. Kada više modela popuni istu prazninu potpuno oprečnim sadržajem, greška postaje vidljiva.
Više studija pokazuje da prosta agregacija izlaza LLM-ova može parirati tačnosti ljudskog grupnog predviđanja. Mehanizam je paralelan Galtonovom eksperimentu sa težinom vola i Surowieckovoj "Mudrosti gomile" — pojedinačne procene su pristrasne, ali agregat poništava nekorelirane greške. [28]
Za AI, ovo znači: pet modela sa 60% individualne tačnosti, sa nekoreliranim greškama, mogu proizvesti agregatne izlaze značajno iznad 60% tačnosti. Matematika favorizuje raznolikost nad individualnom izvrsnošću.
Odlično hvata:
Slabije hvata:
Multi-model validacija je sloj detekcije, a ne garancija. Ona podiže verovatnoću da se halucinacije uhvate. Ne eliminiše ih. Organizacije koje postižu najbolje rezultate kombinuju multi-model unakrsnu validaciju sa domenski specifičnom verifikacijom, kontrolnim tačkama za ljudsku reviziju i utemeljenjem putem alata. [27]
I dalje postoji ograničen standardizovani javni izveštaj koji meri "cross-validation sa pet modela smanjuje halucinacije za X%" kroz različite domene pod kontrolisanim uslovima. Poboljšanje od 8% iz UAF okvira je najjači pojedinačni broj. Produkcione studije slučaja sa multi-model platformi se pojavljuju, ali još nisu objavljene u recenziranim publikacijama.
Najsigurnija pozicija zasnovana na dokazima: multi-model orkestracija je arhitektura za smanjenje rizika koja povećava verovatnoću detekcije. Nije garancija nulte halucinacije. Nijedan pristup ne postiže tu garanciju — kao što matematički dokazi u Sekciji 11 demonstriraju.
Postavite sopstveno pitanje i vidite kako različiti AI modeli koriguju jedni druge.
Isprobajte besplatnoTržište detekcije halucinacija poraslo je za 318% između 2023. i 2025. godine, uz 12,8 milijardi dolara investicija u namenska rešenja. Ova stopa rasta odražava koliko ozbiljno preduzeća shvataju ovaj problem — i koliko su ugrađene zaštite u samim modelima nedovoljne za poslovnu primenu. [35]
| Alat | Tačnost detekcije | Ključna prednost |
|---|---|---|
| Suprmind | Multi-model | 5 AI modela sekvencijalno proveravaju jedni druge — svaki naredni model identifikuje halucinacije, fabricije i logičke greške prethodnog. Detekcija ugrađena u sam proces, ne naknadno. |
| W&B Weave | 91% | Integracija u produkcijske pipeline-ove, rezonovanje lanca misli |
| Arize Phoenix | 90% | Evaluacija na bazi labele, bodovanje pouzdanosti, praćenje u realnom vremenu |
| Comet Opik | 72% | 100% preciznost (nula false positive rezultata), konzervativan pristup |
| Galileo | N/A | Bodovanje indeksa halucinacija, blokiranje u realnom vremenu, CI/CD integracija |
| GPTZero Citation Check | 99%+ | Provera citata u odnosu na veb i akademske baze |
| Future AGI | N/A | Detekcija halucinacija specifična za RAG, praćenje eksperimenata |
| Pythia | N/A | Provera činjenica zasnovana na grafu znanja, regulisane industrije |
Izvori: AIMultiple benčmark (2026) [46], Future AGI (2025) [47], GPTZero/Fortune [45]
Najbolji alati za detekciju hvataju 90-91% halucinacija. To znači da otprilike svaki 10. halucinirani ispis i dalje prođe neopaženo kroz najbolju automatsku proveru. Za aplikacije gde jedna neotkrivena halucinacija ima materijalne posledice — pravni podnesci, medicinske odluke, finansijsko izveštavanje — automatska detekcija je neophodan sloj, ali ne i dovoljan.
Pristup koji nudi Comet Opik je posebno zanimljiv. Sa 72% tačnosti detekcije, on hvata manje halucinacija. Ali ima 100% preciznost — nula lažno pozitivnih rezultata. On nikada ne označava tačnu tvrdnju kao halucinaciju. Za radne tokove gde su lažni alarmi skupi (prekidanje lekara usred dijagnoze, označavanje tačnog pravnog citata za reviziju), ovaj kompromis može biti poželjniji.
| Godina | Najbolja stopa halucinacija | Kontekst |
|---|---|---|
| 2021 | ~21.8% | Era ranog GPT-3 modela |
| 2022 | ~15.0% | RLHF unapređenja u alignment-u |
| 2023 | ~8.0% | Lansiranje GPT-4 i pritisak konkurencije |
| 2024 | ~3.0% | Brza iteracija svih provajdera |
| 2025 | 0.7% | Gemini-2.0-Flash na originalnom Vectara setu podataka |

Četiri godine poboljšanja stopa halucinacija na jednostavnim zadacima sažimanja: 21,8% → 0,7%. Izvori: Vectara [1], AllAboutAI [31]
Ovo je smanjenje od 96% kod najboljih modela tokom četiri godine na Vectara benčmarku za sažimanje teksta. Trend je stvaran i ohrabrujuć.
Ova poboljšanja mere najlakšu verziju problema: sažimanje kratkih dokumenata bez dodavanja neproverenih činjenica. Kada pređemo na realističnije evaluacije, slika se menja:
AA-Omniscience (teška pitanja): 36 od 40 modela će vam pre dati samouveren pogrešan odgovor nego tačan. Samo četiri modela su ostvarila pozitivan indeks sveznanja. [2]
HalluHard (realistični razgovori): Čak i najbolji model (Claude Opus 4.5 sa veb-pretragom) halucinira u 30% slučajeva. Većina modela je u rangu od 50% do 70%. [5]
Vectara novi set podataka (poslovni dokumenti): Stope skaču 3 do 10 puta u poređenju sa originalnim setom. Najbolji rezultat je 3,3%, a ne 0,7%. [1]
Domenski specifični zadaci: Prosek halucinacija u pravu je 18,7%. Prosek u medicini je 15,6%. Ove oblasti nisu pokazale isti trend poboljšanja kao opšte sažimanje teksta. [31]
Napredak je stvaran. Ali preslikavati te sjajne rezultate sa prostih benčmark testova na pouzdanost u poslovnoj primeni — greška je koju podaci jednostavno ne podržavaju.
Ova stranica koristi sledeće primarne izvore:
Benčmark testovi: Vectara HHEM rang-lista (originalni set podataka od ~1.000 dokumenata i osveženi set od 7.700 članaka), Artificial Analysis AA-Omniscience, Google DeepMind FACTS benčmark, OpenAI SimpleQA i PersonQA, HalluHard (švajcarsko-nemački istraživački konzorcijum) i CJR studija tačnosti citiranja.
Sistemske kartice i tehnički izveštaji: OpenAI GPT-5 sistemska kartica, GPT-5.2 ažuriranje, o3/o4-mini sistemska kartica, Anthropic objave za Claude Opus 4.5/4.6 i Sonnet 4.6, Google DeepMind FACTS metodološki rad.
Industrijske studije i podaci o incidentima: Stanford RegLab/HAI studija o pravnom AI-u, MedRxiv istraživanje medicinskih halucinacija, Deloitte globalna AI anketa, Forrester analiza troškova korporativnog AI-a, AllAboutAI kompilacija statistike halucinacija, Business Insider praćenje sudskih presuda, Damien Charlotin baza podataka haluciniranih pravnih citata i GPTZero/Fortune analiza NeurIPS 2025.
Akademska istraživanja: Xu et al. (2024) o nemogućnosti eliminacije halucinacija, Karpowicz (2025) o matematičkoj nemogućnosti kroz tri okvira dokaza, Amazon/ACM WWW 2025 Uncertainty-Aware Fusion okvir, ICML 2025 VeriFY verifikacija tokom treniranja, ACL 2024 Chain-of-Verification.
TruthfulQA — delimično zasićen. Uključen u podatke za trening modela, sadrži neke netačne referentne odgovore i može se "hakovati" do 79,6% tačnosti algoritmom koji nikada ne vidi pitanje.
HaluEval — rešiv putem dužine odgovora. Klasifikator koji označava odgovore duže od 27 karaktera kao halucinirane postiže 93,3% tačnosti, čime podriva validnost benčmarka za poređenje modela.
Nepotvrđeni benčmark testovi iz zajednice — Objave na Reddit-u, tvrdnje sa Twitter-a i blog članci koji citiraju benčmark brojke bez dokumentacije o metodologiji ili informacija o reproduktivnosti su isključeni osim ako se nisu mogli ukrstiti sa primarnim izvorima.
Marketinške tvrdnje provajdera — tamo gde provajder tvrdi specifičnu stopu halucinacija, ali nezavisni benčmark testovi pokazuju drugačije brojke, obe su predstavljene sa naznačenim neslaganjem. Ovo se posebno odnosi na interne Grok benčmarkove kompanije xAI naspram AA-Omniscience rezultata.
Vectara snimci su datirani. Originalni set podataka je evaluiran do aprila 2025. Osveženi set pokriva novembar 2025. do februar 2026, sa najnovijim snimkom datiranim 25. februara 2026. AA-Omniscience je pokrenut u novembru 2025. i ažuriran je sa izlaskom novih modela. FACTS je objavljen u decembru 2025. OpenAI sistemske kartice su datirane po izdanju.
Kada dva benčmarka pokazuju različite brojke za isti model, to obično odražava različite datume evaluacije, različite verzije setova podataka ili različite aspekte tačnosti koji se mere. Mi te neskladnosti naglašavamo umesto da ih usrednjavamo.
Perplexity Sonar modeli nisu navedeni na AA-Omniscience ili Vectara rang-listama. Perplexity koristi osnovne modele (uključujući GPT i DeepSeek varijante), čineći atribuciju halucinacija složenom. Njihovi SimpleQA i Search Arena rezultati su uključeni gde su dostupni.
Claude Opus 4.6 i Sonnet 4.6 su objavljeni u februaru 2026. AA-Omniscience podaci se pojavljuju, ali su rani. Vectara rezultati na novom setu podataka još nisu dostupni za generaciju 4.6.
GPT-5.3 ima AA-Omniscience podatke (51,8% tačnosti za Codex varijantu) ali ograničenu pokrivenost na drugim benčmark testovima u trenutku pisanja.
Domenski specifični podaci za većinu benčmark testova mere opšte znanje. Industrijski specifični podaci o halucinacijama (finansije, medicina, pravo) dolaze prvenstveno iz specijalizovanih studija, a ne sa glavnih rang-lista.
Poslovne cifre troškova dolaze iz anketa i procena, a ne iz verifikovanih baza podataka o incidentima. Cifra od 67,4 milijarde dolara, troškovi verifikacije po zaposlenom i rasponi po incidentu treba da se tretiraju kao indikativni, a ne precizni.
Mesečno: Vectara snimci rang-liste, AA-Omniscience dodavanje novih modela, ažuriranja OpenAI sistemskih kartica, podaci o novim modelima.
Kvartalno: Promene na FACTS rang-listi, uvođenje novih benčmark testova, nalazi akademskih radova, regulatorni razvoji (posebno primena EU AI Akta u vezi sa zahtevima za tačnost).
Po potrebi: Velika izdanja modela, značajni izveštaji o incidentima, prekretnice u sudskim presudama i promene u metodologiji benčmark testova.
Stopa AI halucinacija meri koliko često model generiše lažne ili izmišljene informacije predstavljene kao činjenice. Stopa varira u zavisnosti od benčmark testa. Model može imati rezultat od 0,7% na Vectara testu i 88% na AA-Omniscience testu istovremeno, naprosto zato što ta dva testa mere potpuno različite stvari (doslednost naspram svesti o neznanju).
Nema jedinstvenog odgovora — sve zavisi od zadatka. Na pitanjima znanja: Claude 4.1 Opus postiže neverovatnih 0% (odbija da odgovori radije nego da nagađa). Na sumarizaciji dokumenata: Gemini-2.0-Flash vodi sa stopom od 0,7%. U višedimenzionalnoj tačnosti informacija: Gemini 3 Pro nosi najbolji FACTS rezultat. Za stvarne poslovne primene uvek ukrstite prave modele za pravi tip operacija.
Zavisi od verzije modela. GPT-5.2 (uz veb-pretragu) nudi izvanredne rezultate u poslovnoj primeni. Međutim, najvažnija varijabla kod GPT-a je pristup veb-pretrazi. Kada pretražuje internet, GPT-5 obara stopu halucinacija za 70-80% u poređenju sa tim kada je prepušten samo svojoj lokalnoj bazi podataka.
Ne. Dva nezavisna matematička dokaza demonstrirala su da su halucinacije fundamentalno ograničenje arhitekture jezičkih modela (LLM). To nije inženjerski problem koji čeka softverski ispravku. Stope mogu drastično pasti za prostije zadatke, ali istraživačka zajednica se danas više fokusira na upravljanje rizikom i detekciju grešaka, a ne na jurenje nemogućeg mita o "modelu sa 0% grešaka".
Istraživanja to apsolutno potvrđuju. Različiti AI modeli retko izmišljaju iste lažne informacije jer imaju različite podatke za obuku i arhitekture. Kroz okvire za fuziju više modela (multi-model ansambli) postižu se opipljiva povećanja u tačnosti i detekciji, jer modeli jedni drugima koriguju lažne izlaze.
Saznajte kako multi-model pristup može da zaštiti vaše poslovanje.
Kontaktirajte nas