PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#test-time-training
1 記事
01
2026-08-31
·
推論・高速化
·
★ 会員
·
論文
·
15分で読めます
論文解説 TTPO: 正解ラベルなしで、テストの最中にモデルを鍛える
TTPO: Test-Time Policy Optimization
多数決で作った疑似ラベルは競技数学では約85%外れる。それでも学習が成立するのはなぜか。賛成した出力は蒸留し、反対した出力はRLで罰するという「非対称」な設計を、前提知識ゼロから解説する。