JA EN

#ocr

1 記事

01 ·VLM・マルチモーダル·★ 会員·論文·11分で読めます 文書理解とOCRのいま — 帳票をLLMが読むまで LayoutLM: Pre-training of Text and Layout for Document Image Understanding 請求書やスキャンPDFを機械が読むまでを1から。テキスト検出とCTC、誤りの測り方(CER)から、レイアウトを座標ごと埋め込むLayoutLM系、OCRを丸ごと捨てるDonut系、そして画像をそのままLLMに渡す現在までを、表・手書き・幻覚という実務の壁とあわせて解説する。