Što obećavaju LlamaParse i LlamaExtract
LlamaParse i LlamaExtract tvrtke LlamaIndex među su najpoznatijim alatima u ekosustvu obrade dokumenata umjetnom inteligencijom. Njihovo obećanje: pretvoriti dokumente bilo koje vrste — PDF-ove, skenirane dokumente, obrasce — u strukturirani Markdown tekst, optimiziran za RAG (Retrieval-Augmented Generation) cjevovode i aplikacije temeljene na velikim jezičnim modelima (LLM).
LlamaParse nudi različite načine obrade: Fast (1 Credit po stranici), Balanced (10 Credits), Premium (45 Credits) i Agentic Plus (90 Credits). LlamaExtract nadopunjuje ovo izdvajanjem podataka temeljenim na shemi — definirajte JSON shemu, a alat će izdvojiti strukturirane podatke iz vaših dokumenata.
Na prvi pogled, ovo zvuči uvjerljivo. No, pri bližem pregledu pojavljuju se temeljne slabosti — uz još temeljnije pitanje: Trebamo li nam ove alate uopće?
Zašto LlamaParse postaje zastario: Claude, GPT i drugo mogu to učiniti sami
Evo neugodne istine za LlamaIndex: Moderni vizualni LLM-i čine LlamaParse suvišnim slojem posrednika.
Claude 4, GPT-5, Gemini 2.5 Pro — svi ovi modeli mogu obrađivati dokumente izravno. Oni prihvaćaju PDF-ove i slike kao ulaz, razumiju raspored, tablice i strukturu te isporučuju strukturirani izlaz. Ono što LlamaParse nudi kao složen cjevovod s više načina obrade jest izvorna mogućnost ovih modela.
LlamaIndex sam potvrdio ovaj trend u svom vlastitom blogu: „Osnovna razina jednokratne obrade dokumenata putem snimanja zaslona pomoću najnovijih modela postala je znatno bolja.” Oni priznaju da se točnost čiste LLM obrade drastično povećala.
Što to znači u praksi?
- Nije potreban posrednik: Zašto slati dokumente kroz LlamaParse kada ih Claude razumije izravno?
- Nema sustava Credits: Jedan API poziv na Claude ili GPT troši token-e — nema vlasničkog sustava Credits sa zbunjujućim razinama
- Nema vezanosti za dobavljača: LlamaParse vas veže uz ekosustav LlamaIndex. Izvorni LLM-i su neovisni o dobavljaču
- Nema održavanja: Greške poput sirovog OCR-a problema u verziji 0.6.1 (GitHub Issue #621), gdje je LlamaParse iznenada isporučivao samo sirovi OCR tekst umjesto strukturirane analize, ne postoje kod izvornih LLM API-ja
LlamaParse je u suštini omotač oko LLM-a — a omotači postaju zastarjeli kada temeljna tehnologija sazrije.

Problem granica (Bounding Box): Zašto običan tekst nije dovoljan
No — i ovo je ključna točka — niti LlamaParse niti izvorni LLM-i ne rješavaju stvarni problem: Obrada dokumenata u poduzećima treba više od teksta.
Ironično, LlamaIndex sam tvrdi u svom blogu „LLM API-ji nisu potpuni parseri dokumenata” upravo ovo: Čisti LLM API-ji nemaju ocjene pouzdanosti, granice (bounding boxes) i reference na izvor. No, njihovo vlastito rješenje ima ogromne probleme upravo ovdje:
| Problem | GitHub Issue | Status |
|---|---|---|
| Pogrešna visina granice (bounding box) | #368 | Otvoreno od kolovoza 2024. |
| Vrijednosti BBox = None → pad Pydantic-a | #972 | Popravljeno u listopadu 2025. |
| Zadane vrijednosti umjesto stvarnih koordinata za tablice | #442 | Otvoreno |
| Izdvajanje slika ne uspijeva na rubnim slučajevima | #528 | Otvoreno |
| Sirovi OCR umjesto analize nakon ažuriranja | #621 | Otvoreno |
| Poslovi izdvajanja ne uspijevaju bez poruke o pogrešci | #1107 | Otvoreno (veljača 2026.) |
Temeljni problem: Beg točnih granica (bounding boxes), obrada dokumenata je beskorisna za aplikacije u poduzećima. Zašto?
- Tražilni PDF-ovi: Bez koordinata ne može se stvoriti nevidljivi tekstualni sloj
- Cenzura osobnih podataka (PII): Bez pozicioniranja preciznog do piksela ništa se ne može točno cenzurirati
- Staze revizije: Bez referenci na izvor izdvajanje nije provjerljivo
- Ljudska kontrola (Human-in-the-Loop): Preglednici trebaju vidjeti odakle je izvrijeđena vrijednost došla
Tablice, skenirani dokumenti i zahtjevi poduzeća
Osim problema s granicama, i LlamaParse i pristupi čistim LLM-ima ne uspijevaju dodatnim zahtjevima poduzeća:
Prepoznavanje tablica: Prema APIScout benchmarku 2026., LlamaParse zaostaje ~20% iza specijaliziranih rješenja na složenim višestupčanim tablicama, spojenim ćelijama i tablicama koje se protežu kroz više stranica. Neovisna dubinska analiza tvrtke Undatas potvrđuje: „LlamaParse značajno pati kod složenih tablica, posebno onih s spojenim ćelijama ili složenim zaglavljima.”
Skenirani dokumenti i rukopis: Kod skeniranih dokumenata niske rezolucije točnost drastično pada. Prepoznavanje formula u skenovima? „Visoko nepouzdano.” Rukopis? Samo „Djelomično” prema službenoj matrici značajki.
Službena ograničenja LlamaParse-a:
- Maks. 35 slika po stranici (ostalo se zanemaruje)
- Maks. 64KB teksta po stranici (ostalo se skraćuje)
- Maks. veličina datoteke 512MB, izdvajanje samo 100MB
- Maks. 500 stranica po poslu izdvajanja
- Ugniježđivanje sheme samo na 7 razina dubine
- Nema podrške za DOCX u extract_stateless (GitHub #1077)
PaperOffice AI kao kontrast:
- 800+ specijaliziranih LLM-a — jedan za svaku vrstu dokumenta
- Prepoznavanje tablica s redovima, stupcima, spojenim ćelijama — strukturirani izlaz
- Prepoznavanje rukopisa putem AI Vision — potpisi, annotacije, obrasci
- OMR prepoznavanje — polja za označavanje, krugovi, oznake s točnim koordinatama
- QR i prepoznavanje barkodova uključeno
- 139 jezika s automatskim otkrivanjem

Usporedba troškova: Credits, centi i skriveni troškovi
LlamaParse koristi model cijena temeljen na Credits. 1.000 Credits košta 1,25 USD. Ono što se na prvi pogled čini pristupačnim brzo se zbroji:
| Funkcija | Credits LlamaParse | Trošak LlamaParse po stranici | PaperOffice AI |
|---|---|---|---|
| Osnovna obrada | 1 Credit (Fast) | 0,00125 USD | 0,01 USD (AI-OCR) |
| Kvalitetna obrada | 10–45 Credits | 0,013–0,056 USD | 0,01 USD (AI-OCR) |
| Premium Agentic | 45–90 Credits | 0,056–0,113 USD | 0,03 USD (AI-AI-IDP) |
| Izdvajanje | 5–60 Credits | 0,006–0,075 USD | 0,03 USD (AI-IDP, uključeno) |
Pri usporedivoj kvaliteti (način Premium/Agentic), PaperOffice AI je 2–4 puta jeftiniji. Dodatno:
- PaperOffice: Granice, tražilni PDF, cenzura uključeno
- LlamaParse: Izdvajanje rasporeda košta dodatno +3 Credits po stranici
- PaperOffice: Nema sustava Credits — transparentno cijena po centu po stranici
- LlamaParse: Besplatna razina ograničena na 10.000 Credits mjesečno, zatim plaćanje po potrošnji s ograničenjima
Pri 100.000 stranica mjesečno u Premium načinu: LlamaParse = 5.625 USD vs. PaperOffice AI-IDP = 3.000 USD. Ušteda: 47%.
PaperOffice AI: Što obrada dokumenata u poduzećima doista treba
PaperOffice AI pristupa temeljno drugačije od LlamaParse-a. Umjesto djelovanja kao omotač oko generičkih LLM-ova, PaperOffice kombinira tri specijalizirane tehnologije:
1. Fuzija OCR-a i LLM-a: 800+ specijaliziranih, finog podešavanja LLM-ova — svaki treniran na specifičnim vrstama dokumenata poput računa, ugovora, osobnih iskaznica, dostavnica. Nema generičkog „jednog modela za sve.”
2. Granice (Bounding Boxes) kao temelj: Svaki prepoznati element — tekst, tablica, slika, rukopis — dobiva točne koordinate piksela. To omogućuje:
- Tražilne PDF-ove: Originalni sken + nevidljivi LLM tekstualni sloj = tražilni, kopirajući, arhivabilan
- Cenzuru osobnih podataka (PII): Precizna usklađena cenzura — ne pretraživanje i zamjena teksta, već cenzura precizna do piksela
- Ljudsku kontrolu: Kliknite na izvrijeđenu vrijednost → odmah vidite gdje se ona pojavljuje u originalu
- Staze revizije: Svaka izvrijeđena točka podataka je praćiva i provjerljiva
3. Zero-Shot bez predložaka: Nema predložaka, nema obuke, nema pravila. Prirodno ljudsko usmjeravanje (Natural Human Prompting) — opišite na prirodnom jeziku što želite izdvojiti.
Na vrhu toga: EU podatkovni centri, usklađenost s GDPR-om, dostupnost na vlastitoj infrastrukturi (on-premise). Dok LlamaParse prisiljava sve u oblak (s 48-satnim predmemoriranjem!), PaperOffice nudi potpuni suverenitet nad podacima.
| Značajka | LlamaParse | Izvorni LLM-i | PaperOffice AI |
|---|---|---|---|
| Markdown izlaz | ✅ | ✅ | ✅ |
| Granice (Bounding boxes) | ⚠️ Neispravno | ❌ | ✅ Precizno do piksela |
| Tražilni PDF | ❌ | ❌ | ✅ |
| Cenzura PII-a | ❌ | ❌ | ✅ |
| Tablice (složene) | ⚠️ ~80% | ⚠️ Varijabilno | ✅ Specijalizirano |
| Rukopis | ⚠️ Djelomično | ⚠️ Varijabilno | ✅ AI Vision |
| On-premise (na licu mjesta) | ❌ | ❌ | ✅ |
| GDPR/poslužitelji u EU | ❌ | ⚠️ | ✅ |
| Cijena (poduzeće) | 0,056–0,113 USD | Varijabilno | 0,01–0,03 USD |