JA EN

#document-ai

2 記事

01 ·★ 会員·論文·12分で読めます 論文解説: ピクセル文字表現学習の設計原則 — 文書を「読まずに見る」エンコーダは何で決まるか On the Design Fundamentals of Pixel Text Representation Learning 文字をコードに変換せず、画像のまま意味を掴むエンコーダ。その性能を決めるのはデータ量ではなく4つの設計原則だと示した EMNLP 2026 の論文を、前提知識ゼロから解説する。 02 ·VLM・マルチモーダル·★ 会員·論文·11分で読めます 文書理解とOCRのいま — 帳票をLLMが読むまで LayoutLM: Pre-training of Text and Layout for Document Image Understanding 請求書やスキャンPDFを機械が読むまでを1から。テキスト検出とCTC、誤りの測り方(CER)から、レイアウトを座標ごと埋め込むLayoutLM系、OCRを丸ごと捨てるDonut系、そして画像をそのままLLMに渡す現在までを、表・手書き・幻覚という実務の壁とあわせて解説する。