Co slibují LlamaParse a LlamaExtract
LlamaParse a LlamaExtract od společnosti LlamaIndex patří mezi nejznámější nástroje v ekosystému zpracování dokumentů pomocí umělé inteligence. Jejich slibem je převod dokumentů jakéhokoli druhu – PDF, skenů, formulářů – do strukturovaného textu ve formátu Markdown, optimalizovaného pro RAG pipeline a aplikace založené na velkých jazykových modelech (LLM).
LlamaParse nabízí různé režimy analýzy: Rychlý (1 Credit/stránka), Vyvážený (10 Credits), Prémiový (45 Credits) a Agentic Plus (90 Credits). LlamaExtract toto doplňuje extrakcí dat na základě schématu – definujete schéma JSON a nástroj extrahuje z vašich dokumentů strukturovaná data.
Na první pohled to zní přesvědčivě. Při podrobnějším zkoumání se však objevují zásadní slabiny – spolu s ještě fundamentálnější otázkou: Potřebujeme tyto nástroje vůbec ještě?
Proč se LlamaParse stává zastaralým: Claude, GPT a další to zvládnou sami
Zde je nepříjemná pravda pro společnost LlamaIndex: Moderní vizuální velké jazykové modely činí z LlamaParse nadbytečnou vrstvu middleware.
Claude 4, GPT-5, Gemini 2.5 Pro – všechny tyto modely dokážou zpracovávat dokumenty přímo. Akceptují soubory PDF a obrázky jako vstup, chápou rozložení, tabulky a strukturu a poskytují strukturovaný výstup. To, co LlamaParse nabízí jako komplexní pipeline s více režimy analýzy, je pro tyto modely nativní schopností.
Společnost LlamaIndex tento trend potvrzuje ve svém vlastním blogu: „Výchozí úroveň jednorázové analýzy dokumentů prostřednictvím snímků obrazovky pomocí nejnovějších modelů se výrazně zlepšila." Přiznávají, že přesnost čisté analýzy pomocí LLM dramaticky vzrostla.
Co to znamená v praxi?
- Není potřeba žádný middleware: Proč posílat dokumenty přes LlamaParse, když jim Claude rozumí přímo?
- Žádný systém Credits: Jediné volání API na Claude nebo GPT stojí tokeny – žádný proprietární systém Credits s matoucími úrovněmi
- Žádná závislost na dodavateli: LlamaParse vás váže na ekosystém LlamaIndex. Naturní LLM jsou nezávislé na poskytovateli
- Žádná údržba: Chyby, jako je problém se surovým OCR ve verzi v0.6.1 (GitHub Issue #621), kdy LlamaParse náhle dodával pouze surový OCR text místo strukturované analýzy, u nativních LLM API neexistují
LlamaParse je v podstatě obálka kolem LLM – a obálky se stávají zastaralými, jakmile základní technologie dozraje.

Problém ohraničovacích rámečků: Proč plain text nestačí
Ale – a to je klíčový bod – ani LlamaParse, ani nativní LLM neřeší skutečný problém: Zpracování podnikových dokumentů potřebuje více než jen text.
Ironicky společnost LlamaIndex sama ve svém blogu „LLM API nejsou kompletní analyzátory dokumentů" argumentuje přesně tímto: Čistá LLM API postrádají skóre spolehlivosti, ohraničovací rámečky a zdrojové citace. Ale jejich vlastní řešení má právě zde masivní problémy:
| Problém | GitHub Issue | Stav |
|---|---|---|
| Nesprávná výška ohraničovacího rámečku | #368 | Otevřeno od srpna 2024 |
| Hodnoty BBox = None → pád Pydantic | #972 | Opraveno v říjnu 2025 |
| Výchozí hodnoty místo skutečných souřadnic pro tabulky | #442 | Otevřeno |
| Extrakce obrázků selhává v hraničních případech | #528 | Otevřeno |
| Surový OCR místo analýzy po aktualizaci | #621 | Otevřeno |
| Extrakční úlohy selhávají bez chybové zprávy | #1107 | Otevřeno (únor 2026) |
Zásadní problém zní: Bez přesných ohraničovacích rámečků je zpracování dokumentů pro podnikové aplikace nepoužitelné. Proč?
- Prohledatelné PDF:Bez souřadnic nelze vytvořit neviditelnou textovou vrstvu
- Zaškrtnutí osobních údajů (PII):Bez pixelově přesného umístění nelze nic přesně zaškrtnout
- Audit stopy:Bez referencí na zdroje není extrakce ověřitelná
- Human-in-the-Loop:Kontrolní orgány musí být schopny dohledat původ extrahované hodnoty
Tabulky, skeny a požadavky na firmy
Kromě problémů s ohraničením selhávají jak LlamaParse, tak čistě LLM-based přístupy i v dalších podnikových požadavcích:
Rozpoznávání tabulek: Podle benchmarku APIScout 2026 zaostává LlamaParse u komplexních více-sloupcových tabulek, sloučených buněk a přesahujících tabulek přibližně o 20 % za specializovanými řešeními. Nezávislá hloubková analýza společnosti Undatas potvrzuje: „LlamaParse má značné potíže s komplexními tabulkami, zejména těmi se sloučenými buňkami nebo složitými záhlavími."
Skeny a rukopis: U skenovaných dokumentů s nízkým rozlišením přesnost výrazně klesá. Rozpoznávání vzorců ve skenech? „Vysoce nespolehlivé." Rukopis? Podle oficiální funkční matice je možný pouze „částečně".
Oficiální omezení LlamaParse:
- Maximálně 35 obrázků na stránku (zbytek je ignorován)
- Maximálně 64 KB textu na stránku (zbytek je oříznut)
- Maximální velikost souboru 512 MB, extrakce pouze do 100 MB
- Maximálně 500 stran na extrakční úkol
- Vnoření schématu pouze do hloubky 7 úrovní
- Žádná podpora DOCX v extract_stateless (GitHub #1077)
PaperOffice AI ve srovnání:
- Více než 800 specializovaných LLM – každý pro jeden typ dokumentu
- Rozpoznávání tabulek s řádky, sloupci a spojenými buňkami – strukturovaný export
- Rozpoznávání rukopisu pomocí AI Vision — podpisy, poznámky, formuláře
- Rozpoznávání OMR — zaškrtávací políčka, kruhy, značky s přesnými souřadnicemi
- Rozpoznávání QR kódů a čárových kódů zahrnuto
- 139 jazyků s automatickým rozpoznáním

Srovnání nákladů: Credits, centy a skryté náklady
LlamaParse nutzt ein na základě Credits Cenový model. 1 000 Credits stojí 1,25 USD. Co se na první pohled zdá být dostupné, rychle narůstá:
| Funkce | LlamaParse Credits | Náklady na stránku LlamaParse | PaperOffice AI |
|---|---|---|---|
| Základní parsování | 1 Credit (rychlý) | 0,00125 USD | 0,01 USD (AI-OCR) |
| Kvalitní parsování | 10–45 Credits | 0,013–0,056 USD | 0,01 USD (AI-OCR) |
| Premium Agentic | 45–90 Credits | 0,056–0,113 USD | 0,03 USD (AI-AI-IDP) |
| Extrakce | 5–60 Credits | 0,006–0,075 USD | 0,03 USD (AI-IDP, včetně) |
Při srovnatelné kvalitě (režim Premium/Agentic) je PaperOffice AI 2 až 4krát levnější. Navíc:
- PaperOffice: Ohraničující boxy, vyhledatelný PDF, redakce včetně
- LlamaParse: Výběr rozložení stojí +3 Credits navíc za stránku
- PaperOffice: Žádný systém Credits — transparentní cenová politika za stránku
- LlamaParse: Bezplatná úroveň omezena na 10 000 Credits/měsíc, poté platba podle spotřeby s horními limity
Při 100 000 stránkách/měsíc v režimu Premium: LlamaParse = 5 625 USD vs. PaperOffice AI-IDP = 3 000 USD. Úspora: 47 %.
PaperOffice AI: Co skutečně potřebují firmy pro zpracování dokumentů
PaperOffice AI verfolgt einen grundlegend anderen Ansatz als LlamaParse. Statt als Wrapper um generische LLMs zu fungieren, kombiniert PaperOffice drei spezialisierte Technologien:
1. Fúze OCR-LLM: Více než 800 specializovaných, jemně doladěných LLM – každý trénovaný na konkrétní typy dokumentů, jako jsou faktury, smlouvy, průkazy totožnosti, dodací listy. Žádné generické „jeden model pro všechny".
2. Ohraničující boxy jako základní stavební kámen: Každý rozpoznatelný prvek – text, tabulka, obrázek, rukopis – získá přesné pixelové souřadnice. To umožňuje:
- Prohledatelné PDF: Původní sken + neviditelná textová vrstva od LLM = prohledatelné, kopírovatelné, archivovatelné
- Redakce osobních údajů (PII): Přesná redakce v souladu s GDPR – nejde o vyhledávání a nahrazování textu, ale o redakci s přesností na pixel
- Člověk v procesu (Human-in-the-Loop): Klikněte na extrahovanou hodnotu a okamžitě zobrazte její umístění v originálu
- Auditní stopy: Každý extrahovaný datový bod je vysledovatelný a ověřitelný
3. Zero-shot bez šablon: Žádné šablony, žádné trénování, žádná pravidla. Přirozené zadávání pokynů člověkem – popište přirozeným jazykem, co chcete extrahovat.
K tomu navíc: datová centra v EU, soulad s GDPR, dostupnost jako on-premise řešení. Zatímco LlamaParse vše vynucuje do cloudu (s 48hodinovou mezipamětí!), PaperOffice nabízí plnou datovou suverenitu.
| Funkce | LlamaParse | Nativní LLM | PaperOffice AI |
|---|---|---|---|
| Výstup ve formátu Markdown | ✅ | ✅ | ✅ |
| Ohraničující rámečky (Bounding boxes) | ⚠️ Chybové | ❌ | ✅ S přesností na pixel |
| Prohledatelné PDF | ❌ | ❌ | ✅ |
| Redakce PII | ❌ | ❌ | ✅ |
| Tabulky (komplexní) | ⚠️ ~80 % | ⚠️ Proměnlivé | ✅ Specializované |
| Rukopis | ⚠️ Částečné | ⚠️ Proměnlivé | ✅ AI Vision |
| On-premise | ❌ | ❌ | ✅ |
| GDPR/servery v EU | ❌ | ⚠️ | ✅ |
| Cena (enterprise) | 0,056–0,113 $ | Proměnlivé | 0,01–0,03 $ |