JA EN

#test-time-training

1 記事

01 ·推論・高速化·★ 会員·論文·15分で読めます 論文解説 TTPO: 正解ラベルなしで、テストの最中にモデルを鍛える TTPO: Test-Time Policy Optimization 多数決で作った疑似ラベルは競技数学では約85%外れる。それでも学習が成立するのはなぜか。賛成した出力は蒸留し、反対した出力はRLで罰するという「非対称」な設計を、前提知識ゼロから解説する。