はじめに

2026年6月22〜23日にかけて、Baidu(百度)の研究チームから高精度なドキュメント解析/OCR向け視覚言語モデル(VLM)「Unlimited-OCR」が公開され、同時に論文「Unlimited OCR Works」が発表されました。最大の特徴は、従来のVLMが苦手としていた「数十ページに及ぶ長大なドキュメントを、最大32Kトークンの長さで一度に丸ごと転写(OCR)できる」という長文処理性能にあります。

本稿では、この「Unlimited-OCR」の根幹を支える新規アテンション機構「R-SWA(Reference Sliding Window Attention)」の仕組みから、我々が最も気になる「日本語ドキュメントに対する実際の処理精度と境界条件」、さらには一般コンシューマー向けGPUである RTX 3080 Ti (12GB VRAM) 環境を前提としたローカル導入手順(Transformers/SGLang)およびGGUF量子化モデル運用の懸念点までを、コードを交えて詳しく解説します。

1. Unlimited-OCRの核心:R-SWA(Reference Sliding Window Attention)

従来のTransformerデコーダーをベースにしたVLMで長文OCRを行うと、ページ数が増えるにつれてデコーダー側の KV Cache (Key-Value キャッシュ) が累積し、VRAM容量を瞬く間に圧迫してしまいます。これが「ローカル環境で複数ページのPDFを処理できない」最大のボトルネックでした。

Unlimited-OCRはこの問題を解決するため、DeepSeek-OCRのアーキテクチャをベースにしつつ、以下の革新的なアプローチを採用しています。

  • KV Cacheサイズの一定化: 新規提案された R-SWA 機構により、デコード中に参照する過去のコンテキスト幅(ウィンドウ)をスライドさせながら制限。これにより、KV Cacheのメモリ消費量がドキュメントの長さに依存せずフラット(一定)に保たれます。
  • 3B MoEアーキテクチャ: 総パラメータ数は30億(3B)ですが、推論時にアクティブになるのは約5億(500M)パラメータのみ。これにより、高い表現力と軽快な動作スピードを両立させています。

論文の実験結果では、40ページ以上のドキュメントを一度にコンテキストに入力しても、累積誤差による崩壊を起こすことなくMarkdown形式などで正確に出力できることが示されています。

2. 懸念される「日本語対応」の実態と限界

Hugging Faceのモデルカードには multilingual(多言語)のタグが付与されており、理論上は日本語の文字も認識可能な設計になっています。しかし、結論から言えば「現時点での実用において、日本語は正式対応(公式の主対象)として扱うべきではない」というのが現実的な評価です。

検証項目 英語・中国語(公式サポート) 日本語(実験的サポート)
公式の位置づけ 主対象としてモデル設計・チューニングが施されている。 GitHubのIssue等で「このバージョンでは主に英語と中国語をサポートする」と言及されており、日本語は動作保証外。
レイアウト・表記への耐性 複雑な表組み、改行、LaTeX数式なども高精度にMarkdown化。 ひらがな・カタカナの誤認識、縦書き・ルビ・旧字体での崩壊、禁則処理の無視などが発生しやすい。
長文PDFの処理性能 32Kコンテキストをフルに活かして数十ページを一括転写可能。 長文の読み込み機構自体は作動するが、文字自体の正確な認識保証がないため、ページが増えるほど誤字・脱字が累積するリスクがある。

もし日本語の論文やスキャン書籍、新聞などで試す場合は、まず1〜3ページ程度の短いサンプルで検証し、改行コードの挿入位置、句読点や濁点の有無、長音記号(ー)の処理、そして表組みや脚注が正しく認識されるか確認した上で本格運用に進むことを強く推奨します。

3. RTX 3080 Ti (12GB) 環境でのローカル動作検証ロードマップ

モデル本体は 3B / BF16 で公開されているため、単純計算でモデルのロードに必要なVRAMは約6GB前後です。そのため、12GBのVRAMを搭載した RTX 3080 Ti 環境であれば、推論に必要なコンテキストバッファを含めても十分にローカルで動作させることができます。

公式の推奨環境は Python 3.12.3 + CUDA 12.9 となっており、最新の機械学習スタックに依存しています。

アプローチA: Transformers を用いた直接推論

最も手軽な動作検証方法は、Hugging Faceの transformers ライブラリを用いたPythonスクリプトによる実行です。Unlimited-OCRは独自のデコード制御を行うため、標準 of generate() ではなく、カスタムの model.infer() メソッドを呼び出す設計になっている点に注意してください。

import torch
from transformers import AutoModel, AutoTokenizer

# 1. モデルとトークナイザーのロード(trust_remote_code=Trueが必須)
model_id = "baidu/Unlimited-OCR"
model = AutoModel.from_pretrained(
    model_id, 
    trust_remote_code=True, 
    torch_dtype=torch.bfloat16
).cuda().eval()

tokenizer = AutoTokenizer.from_pretrained(
    model_id, 
    trust_remote_code=True
)

# 2. 推論の実行(カスタムのinferメソッドを使用)
# PDFの画像化ファイルなどを指定
image_path = "document_page_1.jpg"
prompt = "<image>Please transcribe this document into markdown format."

# 出力先ディレクトリへ構造化テキストが保存されます
model.infer(
    tokenizer, 
    prompt=prompt, 
    image_file=image_path, 
    output_path="./output_result"
)
print("OCR転写が完了しました。出力は ./output_result を確認してください。")

アプローチB: SGLang による高速サービング

実用的なスループットを求める場合や、他のアプリケーションからAPI経由で呼び出す場合は、高速推論エンジン SGLang を用いたサーバー起動が推奨されます。

# SGLangのインストール
pip install sglang

# サーバーのバックエンド起動
python3 -m sglang.launch_server --model-path "baidu/Unlimited-OCR" --host 0.0.0.0 --port 30000

起動後は、OpenAI互換のチャット補完APIを叩く形で、バッチ画像やPDFの解析タスクをパイプライン処理できます。

アプローチC: GGUF量子化モデルとLM Studio運用の懸念点

Hugging Face上には、既に有志によって量子化されたGGUF形式(sahilchachra/Unlimited-OCR-GGUFsabafallah/Unlimited-OCR-GGUF)がアップロードされています。しかし、これらを LM Studio や llama.cpp などの汎用LLMサーバーで動作させるのは現時点では困難です。

理由は、このモデルが Vision-Language Model (VLM) かつカスタムコード(trust_remote_code=True)を前提とした特殊なアテンション制御(R-SWA)を行っているためです。通常の言語モデルのようにGGUFを読み込ませるだけでは画像エンコーダーの連携や特殊推論メソッドが機能せず、エラーになる可能性が極めて高いため、ローカル動作は基本的に公式のPythonベース環境で行うのが無難です。

4. 日本語OCRにおける Unlimited-OCR のポジション

現時点で「日本語PDFを高精度に処理したい」という明確な目的がある場合、Unlimited-OCRは本命の選択肢にはなり得ません。用途や環境に合わせて、以下の既存アプローチと比較検証するポジションになります。

  • PaddleOCR / olmOCR (ローカル): 日本語のレイアウト認識や活字認識において、すでに実績があり日本語特化の微調整が効く実力派です。
  • Qwen-VL / InternVL シリーズ (ローカルVLM): 日本語能力が非常に高く、GGUFやvLLMでの運用ノウハウが確立されているオープンソースVLMです。
  • Gemini 1.5 Pro / Claude 3.5 Sonnet (API経由): コストはかかりますが、日本語のルビや崩し字、極めて複雑な表組みに対して最も頑健(ロバスト)で最高峰の精度を誇ります。

まとめ

Baiduの「Unlimited-OCR」は、「複数ページドキュメントの長文一括転写」という特定タスクに対してアテンション機構(R-SWA)からアプローチした非常に挑戦的かつスマートなモデルです。英語や中国語の長文ドキュメント処理においては強力な力を発揮するでしょう。

日本語に関しては発展途上であり、実務で使うにはまだ課題が多いですが、オープンソースVLMの進化とアテンションウィンドウ制御技術のショーケースとして、ローカルのGPU環境(RTX 3080 Tiなど)でその挙動を試す価値は十分にあります。今後の多言語対応のアップデートに期待しましょう。