Baidu presenterar Unlimited-OCR: Revolutionerar textigenkänning i långa dokument

Baidu har avtäckt sin senaste innovation inom artificiell intelligens: Unlimited-OCR. Denna nya modell är specifikt utformad för att övervinna en av de största utmaningarna inom decoder-baserade arkitekturer – den linjära tillväxten av KV-cache (Key-Value cache), vilket ofta agerar som en flaskhals vid bearbetning av omfattande dokument.

Genom en ny metod lyckas modellen bibehålla en konstant KV-cache oavsett dokumentets längd, samtidigt som den sätter en ny standard för prestanda (State-of-the-Art).

Tekniken bakom: R-SWA och mänskligt arbetsminne

Kärnan i Unlimited-OCR är en mekanism kallad Reference Sliding Window Attention (R-SWA). Tekniken är inspirerad av hur det mänskliga arbetsminnet fungerar. Istället för att spara all tidigare information i en ständigt växande cache, fokuserar R-SWA på alla referenstokens (visuella tokens och instruktioner) men behåller endast de 128 senaste utmatningstokens i ett skjutbart fönster.

Detta skapar en form av "mjuk glömska" av avlägsen information, vilket gör att KV-cachen kan komprimeras från en linjär tillväxt till en helt konstant sådan. I praktiken innebär det att modellen kan hantera extremt långa sekvenser utan att förlora hastighet eller kräva orimliga mängder minne.

Arkitektur och effektivitet

Unlimited-OCR bygger på DeepSeek-OCR:s DeepEncoder och använder en kombination av SAM-ViT och CLIP-ViT. Modellen implementerar en 16x token-komprimering, vilket gör att en hel PDF-sida i upplösningen 1024×1024 kan reduceras till endast 256 visuella tokens.

Modellen är en Mixture-of-Experts (MoE) med totalt 3 miljarder parametrar, varav 500 miljoner är aktiva vid varje givet tillfälle. För att maximera effektiviteten har samtliga traditionella attention-lager ersatts av R-SWA.

Imponerande testresultat

I benchmark-testet OmniDocBench v1.6 utklassade Unlimited-OCR sina konkurrenter:

  • Totalpoäng: 93,92 % (jämfört med DeepSeek-OCR:s 87,01 %).
  • Textigenkänning: Edit distance (textavstånd) sjönk från 0,073 till 0,038.
  • Formler: CDM (formula metrics) ökade från 83,37 till 92,61.
  • Tabeller: TEDS-poängen förbättrades från 84,97 till 90,93.
Hantering av långa dokument

Modellen visar prov på exceptionell stabilitet vid stora datamängder:

  • 20-sidiga filer: Bearbetas i ett enda svep med ett edit distance på 0,0572.
  • 40+ sidor: Uppnådde ett edit distance på 0,1069.

Snabbare och mer stabil

Förutom förbättrad precision erbjuder Unlimited-OCR betydande hastighetsfördelar. Genomströmningen (throughput) har ökat till 5 580 TPS (tokens per sekund), vilket är en förbättring på 12,7 % jämfört med DeepSeek-OCR. Tack vare den konstanta KV-cachen förblir latensen stabil oavsett hur lång textsekvensen blir.

Källor

pandaily

Känner du någon som skulle uppskatta detta? Tipsa dem genom att dela artikeln!

Relaterade artiklar

Nytt och Aktuellt

Baidu presenterar Unlimited-OCR: Revolutionerar textigenkänning i långa dokument

Känner du någon som skulle uppskatta detta? Tipsa dem genom att dela artikeln!

Relaterade artiklar

Nytt och Aktuellt

Baidu presenterar Unlimited-OCR: Revolutionerar textigenkänning i långa dokument

Känner du någon som skulle uppskatta detta? Tipsa dem genom att dela artikeln!

Related Articles

Latest Articles