✍️

ゆるく学ぶ技術理論 1~DeepSeek-OCR~

に公開

はじめに

この記事は、筆者が気になった技術について学んだ内容を記録としてまとめたものです。
今回のテーマは、2025年10月に登場したDeepSeek-OCRです。

私自身、このモデルを用いて他のローカルLLMとOCR性能の比較評価を行いました。同一プロンプトで検証したところ、テキストの認識精度はもちろん、レイアウトや位置関係の把握能力が非常に高く、驚かされました。本記事では、DeepSeek-OCRにつて簡単にまとめます。

DeepSeek-OCRについて

概要

DeepSeek-OCRは、中国のAIスタートアップ「DeepSeek(深度求索)」が開発した、強力な画像・文書解析能力を持つマルチモーダル(視覚と言語)モデルです。
従来のOCR(文字認識)とは異なり、LLM(大規模言語モデル)の推論能力を画像認識と密接に組み合わせているため、単なる文字の書き出し(Read)を超えた、文脈理解を伴う高度な処理が可能になっています。

本記事で押さえたいポイント

  • 「文字を読む」のではなく「ページ全体を圧縮して理解する」:従来のOCRとは異なり、視覚情報を極めて小さなトークンに圧縮するアプローチにより、少ないトークン数で高精度な処理を実現しています。
  • 光学圧縮による位置理解:文字を個別に認識するのではなく、特徴マップを用いた「光学圧縮」によって、それぞれの位置関係を構造的に把握します。
  • LLMによる文脈補正:文字形状の認識だけでなく、LLMの推論能力を用いて文脈に基づいた補正を行うことで、認識ミスを劇的に減らしています。

技術と理論:光学的コンテキスト圧縮

DeepSeek-OCRの最大の特徴は、画像を「光学的コンテキスト圧縮」によって、単なるピクセルデータではなく、**画像の特徴を高密度に凝縮した「視覚トークン(数値ベクトル)」**として扱う点にあります。

  • DeepEncoder(視覚エンコーダ)
    Window Attention技術等を駆使し、高解像度の入力画像をメモリ効率よく処理します。さらにCNNを用いて** トークン数を劇的に削減(圧縮)**し、情報密度を高めます。
  • Decoder(デコーダ)
    圧縮された視覚トークンをLLM(DeepSeek3B-MoE等)が直接読み取ります。強力な言語能力と推論能力を使って、視覚情報から** 最初から正しいテキストを生成(OCRタスクを実行)**します。

従来のOCRとの違い

DeepSeek-OCRの技術的な核心は、単なる「文字認識エンジン」ではなく、**「高度な推論能力を持つ大規模言語モデル(LLM)に、高解像度の『目』を与えたこと」**にあります。
従来のOCR技術(CNNやRNNを用いた手法)と比較して、主に以下の4点が大きく改良されています。

1. 動的解像度(Dynamic Resolution)とタイル分割

従来のVLM(Vision-Language Model)の多くは、入力画像を一定サイズ(例:384x384)に縮小して処理していたため、密な文書では文字が潰れてしまう課題がありました。

  • DeepSeekのアプローチ: 元画像の解像度に応じて、画像を複数のタイル(パッチ)に分割して並列処理する 「動的解像度」技術を採用しています。
  • 違い: 「画像全体をぼんやり見る」のではなく、「必要な細部を虫眼鏡で拡大しながら、全体の配置も同時に把握する」ように処理します。これにより、1K〜4Kクラスの高解像度画像に含まれる小さな文字も正確に捉えます。

2. ハイブリッド・ビジョン・エンコーダー

DeepSeekは、役割の異なるエンコーダーを組み合わせる(あるいは階層的に処理する)ことで、全体と細部を両立させています。

  • DeepSeekのアプローチ:

  • 低解像度処理: レイアウト、図の位置、段組みなどの「マクロな構造」を把握。

  • 高解像度処理: 個々の文字形状や数式などの「ミクロな詳細」を抽出。

  • 違い: 従来の行単位の処理とは異なり、
    **「図解の中にある説明文」や「表の中の複雑なデータ」**を、その文脈(コンテキスト)を含めて構造的に理解できるようになりました。

3. 「認識」から「予測」へのパラダイムシフト

従来のOCRは、画像パターンから文字を特定する「パターンマッチング」が主軸でした。

  • DeepSeekのアプローチ: 視覚情報をLLMのトークン空間に投影し、言語的な推論を行います。
  • 違い: 従来は「0」か「O」か迷う場面でも形状だけで判断していましたが、DeepSeekは「計算式の途中だから、これは数字の『0』であるはずだ」という言語的な推論を同時に行います。これにより、かすれた文字や手書き文字の認識率が向上しました。

4. 学習データセットの質と量

  • DeepSeekのアプローチ: インターネット上の膨大な画像・テキストペアに加え、LaTeX(数式)、プログラミングコード、複雑な表構造を含む「構造化文書」を大量に学習**させています。
  • 違い: 出力形式が単なるテキストの羅列ではなく、最初からMarkdownやJSON、LaTeXといった「再利用可能な構造化データ」として生成できる点が、エンジニアリングにおける大きな利点です。

まとめ

本記事ではDeepSeek-OCRの技術的特徴について解説しました。

  • 画像内の文字を個別に認識するのではなく、「光学圧縮」を用いてページ全体の特徴マップとして位置関係ごと理解している。
  • LLMの強力な推論能力を統合することで、視覚情報の不足を文脈で補正し、OCR精度を飛躍的に向上させている。
  • 結果として、複雑なレイアウトや数式を含む文書であっても、構造を維持したまま高精度なデジタル化が可能になっている。

Discussion