JA EN

#contrastive-learning

5 記事

01 ·★ 会員·論文·12分で読めます 論文解説: ピクセル文字表現学習の設計原則 — 文書を「読まずに見る」エンコーダは何で決まるか On the Design Fundamentals of Pixel Text Representation Learning 文字をコードに変換せず、画像のまま意味を掴むエンコーダ。その性能を決めるのはデータ量ではなく4つの設計原則だと示した EMNLP 2026 の論文を、前提知識ゼロから解説する。 02 ·機械学習の基礎·★ 会員·論文·14分で読めます 自己教師あり学習 — ラベルなしデータが宝になった日 A Simple Framework for Contrastive Learning of Visual Representations 人がラベルを貼らなくても、データは自分で問題を作れる。マスク予測と対照学習という2つの流派を、比喩→InfoNCEの式→動く図→PyTorchコードの順に前提知識ゼロから解説し、LLMの事前学習がなぜ「最大の自己教師あり学習」なのかまでつなげます。 03 ·情報理論·★ 会員·論文·14分で読めます 相互情報量 — 「知っている」を測る Representation Learning with Contrastive Predictive Coding 片方を知ると、もう片方の迷いがどれだけ減るか。それを1つの数字にしたのが相互情報量です。エントロピーの引き算という定義から、条件付き相互情報量・データ処理不等式・推定の難しさを経て、対照学習のInfoNCEがなぜ「相互情報量の下限」と呼ばれるのかまでをつなげます。 04 ·音声系·★ 会員·論文·11分で読めます 論文解説: Interpretable MEG Decoding of Perceived Speech — 脳磁図から「聞いた音声」を当てるAIの中身を、脳地図として読む Interpretable MEG Decoding of Perceived Speech: Cortical Sources and the Stimulus Features That Drive Retrieval 脳磁図(MEG)3秒分から、その人が聞いていた音声を1005候補中39.75%で言い当てる——しかも学習済みの重みを大脳皮質の「どこ」と「どんなリズム」に翻訳でき、遮蔽実験で「何を手がかりにしたか」まで特定できるデコーダの論文を、1から解説する。 05 ·VLM・マルチモーダル·★ 会員·論文·9分で読めます 論文解説: CLIP — 言葉と画像を同じ地図に置く Learning Transferable Visual Models From Natural Language Supervision CLIP原論文(Radford et al., 2021)を本文だけを根拠に読む。バッチ内の正例と負例で学ぶ対照学習の仕組み、テキスト側が分類器の重みを作るというゼロショットの正体、プロンプトで5%動く事実、そして論文自身が並べた長い限界のリスト。