PaperLens
紙
学生版
社会人版
JA
EN
◐
Googleでログイン
ログイン
読む
ホーム
論文精読
新着
教科書
深める
体系
ラボ
業界地図
みんなの貢献
用語集
自分
探す
読み放題
マイページ
#llm-serving
4 記事
01
2026-09-03
·
エージェント
·
★ 会員
·
論文
·
22分で読めます
論文解説: Training Agents to Evolve with Their Harness — ハーネスごと進化するエージェントを訓練する
Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report
プロンプトやツール定義を毎週書き換える本番環境で、小型モデルはなぜ壊れるのか。淘宝ライブのAIアバター配信を動かすチームが提案する Harness-Aware Training(HAT)を、比喩から数式・実測値・限界まで1から解説する。
02
2026-09-03
·
推論・高速化
·
★ 会員
·
論文
·
18分で読めます
論文解説: 本番トラフィックから事後学習へ — 社内200アプリを1つの自前LLMに寄せる
From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix
データ所在地の制約で自前ホストせざるを得ない企業が、増え続けるモデル群を1つに畳む方法。本番の失敗を人手で分類し、弱い3軸それぞれにGRPO専門家を作り、SLERPで重みを混ぜる。3種類の報酬ハッキングの実例つき。
03
2026-08-27
·
エージェント
·
★ 会員
·
論文
·
18分で読めます
論文解説: FreeToken — 手元のPCを「一台の推論基盤」として使い切る帯域適応型MoEサービング
FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution
公開重みの巨大MoEを、データセンターではなく手元のPCで動かすためのサービング系FreeToken。ミスしたエキスパートをPCIeで運ぶかCPUでその場で計算するかを、実測した2つの帯域の比だけで決めるq*ポリシーを中心に読み解く。
04
2026-08-12
·
エージェント
·
★ 会員
·
論文
·
10分で読めます
論文解説: Macaron-V1 — 凍結ベース×LoRA混合で「出荷後も育つ」エージェントモデルを作る
Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA
Mind Labのオープンエージェントモデル群Macaron-V1を論文本文から解説。凍結した744Bベースに4枚のLoRA専門家を重ねてターンごとに1枚選ぶMixture-of-LoRAと、モデル+ハーネスのペアを世代ごとに鍛える再帰的自己改善ループの中身を追う。