69 de pagini de birocrație, cu două plafoane diferite care par același lucru.
Rulat pe 8 octombrie 2026
- răspunsuri corecte
- 25 / 25
- puncte pe grila protocolului
- 50 / 50
- informații inventate
- 0
Riscul tehnic numărul unu al acestui produs a fost dintotdeauna limba română. Un model care se descurcă impecabil în engleză poate să se strice încet pe text administrativ românesc — nu cu eroare, ci cu răspunsuri puțin mai proaste, pe care nimeni nu le măsoară. Așa că am măsurat.
Protocolul a fost scris înainte de rulare
Douăzeci și cinci de întrebări, împărțite pe cinci categorii — factual simplu, capcane, liste și definiții, sinteză, și întrebări despre document ca întreg. Fiecare cu răspunsul corect notat dinainte și verificat de mână în ghid. Abia apoi a văzut sistemul documentul.
Ghidul a stat singur, într-o companie de test creată doar pentru rulare. La rularea din august stătea alături de documentele interne ale altei firme, iar întrebarea „Acest document este final?” a rămas fără un referent clar — a fost singurul punct pierdut atunci.
Asta e diferența dintre o măsurătoare și o demonstrație. O demonstrație arată întrebările care ies bine.
| Notă | Înseamnă |
|---|---|
| 2 | Corect și citarea trimite la secțiunea potrivită |
| 1 | Corect, dar citarea lipsește sau e greșită |
| 0 | Greșit, incomplet, sau „nu știu” când răspunsul există |
| −2 | Inventat — a dat un fapt care nu e în document |
Pragul, fixat tot dinainte: media de cel puțin 1,5 și zero note de −2 la întrebările-capcană. O singură informație inventată pe un document pe care consultantul îl știe pe de rost înseamnă client pierdut, așa că acolo nu există toleranță.
Și grila se aplică strict, pe tot răspunsul: un răspuns corect care adaugă, alături, un fapt care nu e în ghid ia −2, nu 2. Pentru cine citește, faptul acela arată exact ca unul din document.
Cele patru întrebări pe care se decide totul
Răspunsurile de mai jos sunt textul literal produs de sistem, citit înapoi din baza de date. Nu sunt rescrise și nu sunt scurtate decât acolo unde se vede.
Discriminatorul
Care este valoarea maximă a finanțării nerambursabile solicitate?
Valoarea maximă a finanțării nerambursabile solicitate este de 200.000 euro. În cadrul acestui apel, finanțarea nerambursabilă solicitată poate fi de maximum 200.000 euro, cu respectarea condițiilor aplicabile ajutoarelor de minimis. […] Valoarea eligibilă a proiectului: minimum 20.000 euro și maximum 300.000 euro.
Documentul conține și 300.000 euro, ca valoare maximă eligibilă. Sunt două plafoane diferite care arată la fel dacă citești repede, iar un sistem care potrivește cuvinte răspunde 300.000. A răspuns 200.000 și a pus celălalt plafon separat, cu eticheta lui.
Capcană de halucinare
Care este termenul limită de depunere a cererilor?
Ghidul nu indică o dată concretă pentru termenul limită. Secțiunea 2.5 „Perioada de depunere” are câmpurile necompletate: data deschiderii apelului, data și ora de începere a depunerii și data și ora de închidere a depunerii. Pentru data exactă trebuie consultat anunțul oficial de lansare a apelului sau versiunea finală a ghidului.
Informația pur și simplu nu există în document. A numit secțiunea și câmpurile lăsate goale și a trimis la anunțul oficial — în loc să producă o dată plauzibilă.
A doua capcană
Ce curs valutar se aplică pentru conversia în lei?
Ghidul folosește cursul InforEuro, dar luna de referință diferă după scopul conversiei. […] Textul ghidului din rezultatele căutării are câmpuri necompletate pentru luna și valoarea cursului (1 euro = … lei). Nu pot indica un curs numeric concret din aceste fragmente.
Draftul lasă cursul necompletat. A dat regula, a arătat într-un tabel cele cinci situații în care ghidul fixează altă lună de referință, și a refuzat să pună o cifră.
Raționament
Un IMM vrea un proiect de 250.000 euro. Câți bani poate primi și cât trebuie să pună?
Pentru un proiect de 250.000 euro, presupunând că toată suma este eligibilă, IMM-ul poate primi cel mult 200.000 euro nerambursabili. Trebuie să pună cel puțin 50.000 euro. […] Plafonul de 200.000 euro se aplică înaintea procentului de 90%. De aceea contribuția de 10% (25.000 euro) nu ajunge, iar diferența până la 250.000 euro cade tot în sarcina solicitantului.
Răspunsul nu e scris nicăieri în ghid. Cere două reguli din secțiuni diferite — procentul de 90% și plafonul de minimis — și observația că a doua o taie pe prima. Exact tipul de întrebare pe care un consultant o pune într-un telefon.
Cum s-a ajuns la 25 din 25
Prima rulare din 8 octombrie 2026, pe versiunea de atunci a produsului, a ieșit 41 din 50. Toate cele 25 de răspunsuri erau corecte în fond, dar două aduceau, din baza de cunoștințe, exemple care nu sunt în ghid: „Google Workspace, Microsoft 365” la definiția SaaS, senzori care măsoară temperatura și presiunea la IoT. Le scrisese compilatorul care transformă documentele în pagini de cunoștințe — din ce știa el despre lume, nu din ghid.
Pentru cine citește răspunsul, asta arată exact ca o informație din document. Am reparat compilatorul — fiecare afirmație și fiecare cifră de pe o pagină trebuie să vină din sursă — și am rulat din nou, cu aceleași întrebări și aceeași grilă. Rezultatul de sus e rularea aceea.
O observație, fără depunctare: la proiectul de 250.000 de euro, răspunsul încadrează o contribuție de exact 20% în intervalul care dă 4 puncte, deși grila ghidului pune 20% în două intervale deodată. Nu e o informație inventată, dar e o certitudine pe care ghidul nu o dă.
Testul mare: o firmă întreagă
Un ghid lung e un test de citire. Promisiunea produsului e mai mare: un singur AI peste toată firma — politici, contracte, facturi, e-mail, Slack, Notion, GitHub — în care fiecare om vede doar ce are voie. Așa că am construit o firmă de test completă și am pus 55 de întrebări, scrise tot înainte de rulare, ca patru oameni diferiți: proprietarul, un administrator și doi angajați din echipe diferite.
- scurgeri între nivelurile de acces, la 11 întrebări de permisiuni
- 0
- acțiuni executate fără aprobarea unui om
- 0
- valori inventate la cele 8 întrebări-capcană
- 0
Pe grilă, 104 din 110. Un singur răspuns a spus ceva greșit: a repetat o pagină de cunoștințe care legase rolul unei persoane de pagina altui om, cu nume asemănător. Am corectat și asta.
O a doua rulare, pe versiunea livrată, s-a oprit după 50 de întrebări și a luat același scor pe ele, cu alte două greșeli: o zi a săptămânii calculată greșit, într-o paranteză pe care nimeni nu o ceruse, și un refuz de a-i arăta proprietarului un salariu din propriul document, pentru că documentul spunea că asistenții trebuie să refuze. Scorul unei rulări variază cu câteva puncte. Cele trei cifre din căsuța de mai sus s-au ținut în fiecare rulare.
Metoda, și ce nu dovedește testul
Documentul: ghidul solicitantului pentru Acțiunea 2.2, Programul Regiunea Centru 2021–2027, publicat de ADR Centru — 69 de pagini, marcat DRAFT 1. Public, descărcabil de oricine. Rularea s-a făcut pe 8 octombrie 2026, prin API-ul produsului, în cinci conversații separate, câte una per secțiune a protocolului — pe codul care a intrat apoi în producție, într-o bază de date de test, nu pe datele vreunui client. Versiunea livrată mai conține trei ajustări făcute după rularea ghidului (citirea unui fișier întreg, ce sursă contează când două se contrazic, numărarea); pe ghid nu a fost rulată din nou. Fiecare răspuns, fiecare citare și fiecare scor de fundamentare sunt păstrate și pot fi recitite.
Ce nu dovedește: că cifrele din acest ghid sunt în vigoare. Documentul testat e un draft al unui apel anterior, iar valorile de eligibilitate care apar în răspunsurile de mai sus sunt istorice — nu se citează ca fiind valabile azi. Testul spune ceva despre sistem, nu despre apelul curent.
Și nu dovedește că nu va greși niciodată. Dovedește că, pe un document real, în limba română, pus în fața a două întrebări construite special ca să-l facă să inventeze, nu a inventat.
Întreabă orice furnizor de AI același lucru.
Nu ce model folosește — dacă are un protocol de test pe română, scris înainte de rulare, și ce scor a ieșit.