Baidu har avtäckt sin senaste innovation inom artificiell intelligens: Unlimited-OCR. Denna nya modell är specifikt utformad för att övervinna en av de största utmaningarna inom decoder-baserade arkitekturer – den linjära tillväxten av KV-cache (Key-Value cache), vilket ofta agerar som en flaskhals vid bearbetning av omfattande dokument.
Genom en ny metod lyckas modellen bibehålla en konstant KV-cache oavsett dokumentets längd, samtidigt som den sätter en ny standard för prestanda (State-of-the-Art).
Tekniken bakom: R-SWA och mänskligt arbetsminne
Kärnan i Unlimited-OCR är en mekanism kallad Reference Sliding Window Attention (R-SWA). Tekniken är inspirerad av hur det mänskliga arbetsminnet fungerar. Istället för att spara all tidigare information i en ständigt växande cache, fokuserar R-SWA på alla referenstokens (visuella tokens och instruktioner) men behåller endast de 128 senaste utmatningstokens i ett skjutbart fönster.
Detta skapar en form av "mjuk glömska" av avlägsen information, vilket gör att KV-cachen kan komprimeras från en linjär tillväxt till en helt konstant sådan. I praktiken innebär det att modellen kan hantera extremt långa sekvenser utan att förlora hastighet eller kräva orimliga mängder minne.
Arkitektur och effektivitet
Unlimited-OCR bygger på DeepSeek-OCR:s DeepEncoder och använder en kombination av SAM-ViT och CLIP-ViT. Modellen implementerar en 16x token-komprimering, vilket gör att en hel PDF-sida i upplösningen 1024×1024 kan reduceras till endast 256 visuella tokens.
Modellen är en Mixture-of-Experts (MoE) med totalt 3 miljarder parametrar, varav 500 miljoner är aktiva vid varje givet tillfälle. För att maximera effektiviteten har samtliga traditionella attention-lager ersatts av R-SWA.
Imponerande testresultat
I benchmark-testet OmniDocBench v1.6 utklassade Unlimited-OCR sina konkurrenter:
- Totalpoäng: 93,92 % (jämfört med DeepSeek-OCR:s 87,01 %).
- Textigenkänning: Edit distance (textavstånd) sjönk från 0,073 till 0,038.
- Formler: CDM (formula metrics) ökade från 83,37 till 92,61.
- Tabeller: TEDS-poängen förbättrades från 84,97 till 90,93.
Hantering av långa dokument
Modellen visar prov på exceptionell stabilitet vid stora datamängder:
- 20-sidiga filer: Bearbetas i ett enda svep med ett edit distance på 0,0572.
- 40+ sidor: Uppnådde ett edit distance på 0,1069.
Snabbare och mer stabil
Förutom förbättrad precision erbjuder Unlimited-OCR betydande hastighetsfördelar. Genomströmningen (throughput) har ökat till 5 580 TPS (tokens per sekund), vilket är en förbättring på 12,7 % jämfört med DeepSeek-OCR. Tack vare den konstanta KV-cachen förblir latensen stabil oavsett hur lång textsekvensen blir.

