Šta LlamaParse i LlamaExtract obećavaju
LlamaParse i LlamaExtract kompanije LlamaIndex među su najpoznatijim alatima u ekosistemu za obradu dokumenata veštačkom inteligencijom. Njihovo obećanje: pretvaranje dokumenata bilo koje vrste — PDF-ova, skeniranih dokumenata, formulara — u strukturirani Markdown tekst, optimizovan za RAG (Retrieval-Augmented Generation) cevovode i aplikacije zasnovane na velikim jezičkim modelima (LLM).
LlamaParse nudi različite režime obrade: Brzi (1 Credit po strani), Balansirani (10 Credits), Premium (45 Credits) i Agentic Plus (90 Credits). LlamaExtract nadovezuje se na ovo sa ekstrakcijom podataka zasnovanom na šemi — definišete JSON šemu, a alat ekstrahuje strukturirane podatke iz vaših dokumenata.
Na prvi pogled, ovo zvuči ubedljivo. Međutim, pri bližem pregledu pojavljuju se fundamentalne slabosti — kao i još jedna, još fundamentalnija pitanja: Da li nam uopšte više trebaju ovi alati?
Zašto LlamaParse postaje zastareo: Claude, GPT i drugo mogu to sami
Evo neprijatne istine za LlamaIndex: Moderni vizuelni LLM-i čine LlamaParse suvišnim slojem posrednika.
Claude 4, GPT-5, Gemini 2.5 Pro — svi ovi modeli mogu obrađivati dokumente direktno. Oni prihvataju PDF-ove i slike kao ulaz, razumeju raspored, tabele i strukturu, te isporučuju strukturiran izlaz. Ono što LlamaParse nudi kao kompleksan cevovod sa više režima obrade jeste urođena sposobnost ovih modela.
LlamaIndex sama potvrđuje ovaj trend u svom blogu: „Osnovni nivo jednog koraka za obradu dokumenata putem snimanja ekrana pomoću najnovijih modela postao je mnogo bolji.” Oni priznaju da je tačnost čiste LLM obrade drastično porasla.
Šta to znači u praksi?
- Nije potreban posrednik: Zašto slati dokumente kroz LlamaParse kada ih Claude razume direktno?
- Nema sistema Credits: Jedan API poziv ka Claude ili GPT košta tokene — nema vlasničkog sistema Credits sa zbunjujućim nivoima
- Nema zaključavanja za dobavljača: LlamaParse vas vezuje za ekosistem LlamaIndex-a. Urođeni LLM-i su nezavisni od dobavljača
- Nema održavanja: Greške poput sirovog OCR problema u verziji 0.6.1 (GitHub Issue #621), gde je LlamaParse iznenada isporučivao samo sirovi OCR tekst umesto strukturirane analize, ne postoje kod urođenih LLM API-ja
LlamaParse je suštinski omotač oko LLM-ova — a omotači postaju zastareli kada osnovna tehnologija sazri.

Problem granica (Bounding Box): Zašto običan tekst nije dovoljan
Ali — a ovo je ključna tačka — niti LlamaParse niti urođeni LLM-i rešavaju stvarni problem: Obrada dokumenata u preduzećima zahteva više od teksta.
Ironično, LlamaIndex sama tvrdi u svom blogu „LLM API-ji nisu kompletni parseri dokumenata” upravo ovo: Čisti LLM API-ji nemaju ocene pouzdanosti, granice (bounding boxes) i reference na izvor. Ali njihovo sopstveno rešenje ima ogromne probleme upravo ovde:
| Problem | GitHub Issue | Status |
|---|---|---|
| Netačna visina granice (bounding box) | #368 | Otvoreno od avgusta 2024. |
| Vrednosti BBox = None → pad Pydantic-a | #972 | Ispravljeno oktobra 2025. |
| Podrazumevane vrednosti umesto stvarnih koordinata za tabele | #442 | Otvoreno |
| Ekstrakcija slika ne uspeva na graničnim slučajevima | #528 | Otvoreno |
| Sirovi OCR umesto analize nakon ažuriranja | #621 | Otvoreno |
| Poslovi ekstrakcije ne uspevaju bez poruke o grešci | #1107 | Otvoreno (februar 2026.) |
Fundamentalni problem: Beg tačnih granica (bounding boxes), obrada dokumenata je beskorisna za aplikacije u preduzećima. Zašto?
- Pretraživi PDF-ovi: Bez koordinata, ne može se kreirati nevidljivi sloj teksta
- Cenzura ličnih podataka (PII): Bez pozicije precizne do piksela, ništa se ne može tačno cenzurisati
- Tragovi revizije: Bez referenci na izvor, ekstrakcija nije proverljiva
- Ljud u petlji (Human-in-the-Loop): Pregledači moraju da vide odakle je ekstrahovana vrednost došla
Tabele, skenirani dokumenti i zahtevi preduzeća
Pored problema sa granicama, i LlamaParse i pristupi zasnovani isključivo na LLM-ima ne uspevaju u dodatnim zahtevima preduzeća:
Prepoznavanje tabela: Prema APIScout benchmarku 2026, LlamaParse zaostaje oko 20% iza specijalizovanih rešenja na složenim tabelama sa više kolona, spojenim ćelijama i tabelama koje se protežu preko više strana. Nezavisna dubinska analiza kompanije Undatas potvrđuje: „LlamaParse značajno pati kod složenih tabela, posebno onih sa spojenim ćelijama ili složenim zaglavljima.”
Skenirani dokumenti i rukopis: Kod skeniranih dokumenata niske rezolucije, tačnost drastično opada. Prepoznavanje formula u skenovima? „Visoko nepouzdano.” Rukopis? Samo „Delimično” prema zvaničnoj matrici funkcija.
Zvanična ograničenja LlamaParse-a:
- Maks. 35 slika po strani (ostalo se ignoriše)
- Maks. 64KB teksta po strani (ostalo se skraćuje)
- Maks. veličina fajla 512MB, ekstrakcija samo 100MB
- Maks. 500 strana po poslu ekstrakcije
- Ugnježđivanje šeme samo do dubine od 7 nivoa
- Nema podrške za DOCX u extract_stateless (GitHub #1077)
PaperOffice AI kao kontrast:
- Preko 800 specijalizovanih LLM-ova — po jedan za svaki tip dokumenta
- Prepoznavanje tabela sa redovima, kolonama, spojenim ćelijama — strukturirani izlaz
- Prepoznavanje rukopisa putem AI Vision — potpisi, anotacije, formulari
- OMR prepoznavanje — polja za štikiranje, krugovi, oznake sa tačnim koordinatama
- QR i prepoznavanje barkodova uključeno
- 139 jezika sa automatskim detektovanjem

Poređenje troškova: Credits, centi i skriveni troškovi
LlamaParse koristi cenovni model zasnovan na Credits. 1.000 Credits košta 1,25 USD. Ono što na prvi pogled zvuči pristupačno, brzo se sabere:
| Funkcija | Credits LlamaParse-a | Trošak LlamaParse-a po strani | PaperOffice AI |
|---|---|---|---|
| Osnovna obrada | 1 Credit (Brzi) | 0,00125 USD | 0,01 USD (AI-OCR) |
| Kvalitetna obrada | 10–45 Credits | 0,013–0,056 USD | 0,01 USD (AI-OCR) |
| Premium Agentic | 45–90 Credits | 0,056–0,113 USD | 0,03 USD (AI-AI-IDP) |
| Ekstrakcija | 5–60 Credits | 0,006–0,075 USD | 0,03 USD (AI-IDP, uključeno) |
Pri uporedivom kvalitetu (Premium/Agentic režim), PaperOffice AI je 2–4 puta jeftiniji. Dodatno:
- PaperOffice: Granice, pretraživi PDF, cenzura uključeno
- LlamaParse: Ekstrakcija rasporeda košta dodatnih 3 Credits po strani
- PaperOffice: Nema sistema Credits — transparentno cenovnik centi po strani
- LlamaParse: Besplatni nivo ograničen na 10.000 Credits mesečno, zatim plaćanje po upotrebi sa limitima
Pri obradi 100.000 strana mesečno u Premium režimu: LlamaParse = 5.625 USD naspram PaperOffice AI-IDP = 3.000 USD. Ušteda: 47%.
PaperOffice AI: Šta obrada dokumenata u preduzećima zaista treba
PaperOffice AI pristupa fundamentalno drugačije od LlamaParse-a. Umesto da deluje kao omotač oko generičkih LLM-ova, PaperOffice kombinuje tri specijalizovane tehnologije:
1. Fuzija OCR i LLM: Preko 800 specijalizovanih, finih LLM-ova — svaki obučen na specifične tipove dokumenata kao što su fakture, ugovori, identifikacioni dokumenti, dostavnice. Nema generičkog „jedan model za sve.”
2. Granice (Bounding Boxes) kao temelj: Svaki prepoznati element — tekst, tabela, slika, rukopis — dobija tačne koordinate u pikselima. Ovo omogućava:
- Pretraživi PDF-ovi: Originalni sken + nevidljivi sloj teksta LLM-a = pretraživ, kopiriv, arhivabilan
- Cenzura ličnih podataka (PII): Precizna usklađena cenzura — ne pretraga i zamena teksta, već cenzura precizna do piksela
- Ljud u petlji: Klik na ekstrahovanu vrednost → trenutno vidite gde se ona pojavljuje u originalu
- Tragovi revizije: Svaki ekstrahovani podatak je sledljiv i proverljiv
3. Zero-Shot bez šablona: Nema šablona, nema obuke, nema pravila. Prirodno ljudsko promptovanje — opišite na prirodnom jeziku šta želite da ekstrahujete.
Pored toga: Podaci u EU, usklađeno sa GDPR-om, dostupno za instalaciju na licu mesta (on-premise). Dok LlamaParse forsira sve u cloud (sa keširanjem od 48 sati!), PaperOffice nudi potpuni suverenitet nad podacima.
| Funkcionalnost | LlamaParse | Urođeni LLM-i | PaperOffice AI |
|---|---|---|---|
| Izlaz u Markdown-u | ✅ | ✅ | ✅ |
| Granice (Bounding boxes) | ⚠️ Neispravno | ❌ | ✅ Precizno do piksela |
| Pretraživi PDF | ❌ | ❌ | ✅ |
| Cenzura ličnih podataka (PII) | ❌ | ❌ | ✅ |
| Tabele (složene) | ⚠️ ~80% | ⚠️ Varijabilno | ✅ Specijalizovano |
| Rukopis | ⚠️ Delimično | ⚠️ Varijabilno | ✅ AI Vision |
| Instalacija na licu mesta (On-premise) | ❌ | ❌ | ✅ |
| GDPR / serveri u EU | ❌ | ⚠️ | ✅ |
| Cena (za preduzeća) | 0,056–0,113 USD | Varijabilno | 0,01–0,03 USD |