PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#document-ai
2 記事
01
2026-09-07
·
★ 会員
·
論文
·
12分で読めます
論文解説: ピクセル文字表現学習の設計原則 — 文書を「読まずに見る」エンコーダは何で決まるか
On the Design Fundamentals of Pixel Text Representation Learning
文字をコードに変換せず、画像のまま意味を掴むエンコーダ。その性能を決めるのはデータ量ではなく4つの設計原則だと示した EMNLP 2026 の論文を、前提知識ゼロから解説する。
02
2026-08-26
·
VLM・マルチモーダル
·
★ 会員
·
論文
·
11分で読めます
文書理解とOCRのいま — 帳票をLLMが読むまで
LayoutLM: Pre-training of Text and Layout for Document Image Understanding
請求書やスキャンPDFを機械が読むまでを1から。テキスト検出とCTC、誤りの測り方(CER)から、レイアウトを座標ごと埋め込むLayoutLM系、OCRを丸ごと捨てるDonut系、そして画像をそのままLLMに渡す現在までを、表・手書き・幻覚という実務の壁とあわせて解説する。