JA EN

#llm-serving

4 記事

01 ·エージェント·★ 会員·論文·22分で読めます 論文解説: Training Agents to Evolve with Their Harness — ハーネスごと進化するエージェントを訓練する Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report プロンプトやツール定義を毎週書き換える本番環境で、小型モデルはなぜ壊れるのか。淘宝ライブのAIアバター配信を動かすチームが提案する Harness-Aware Training(HAT)を、比喩から数式・実測値・限界まで1から解説する。 02 ·推論・高速化·★ 会員·論文·18分で読めます 論文解説: 本番トラフィックから事後学習へ — 社内200アプリを1つの自前LLMに寄せる From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix データ所在地の制約で自前ホストせざるを得ない企業が、増え続けるモデル群を1つに畳む方法。本番の失敗を人手で分類し、弱い3軸それぞれにGRPO専門家を作り、SLERPで重みを混ぜる。3種類の報酬ハッキングの実例つき。 03 ·エージェント·★ 会員·論文·18分で読めます 論文解説: FreeToken — 手元のPCを「一台の推論基盤」として使い切る帯域適応型MoEサービング FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution 公開重みの巨大MoEを、データセンターではなく手元のPCで動かすためのサービング系FreeToken。ミスしたエキスパートをPCIeで運ぶかCPUでその場で計算するかを、実測した2つの帯域の比だけで決めるq*ポリシーを中心に読み解く。 04 ·エージェント·★ 会員·論文·10分で読めます 論文解説: Macaron-V1 — 凍結ベース×LoRA混合で「出荷後も育つ」エージェントモデルを作る Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA Mind Labのオープンエージェントモデル群Macaron-V1を論文本文から解説。凍結した744Bベースに4枚のLoRA専門家を重ねてターンごとに1枚選ぶMixture-of-LoRAと、モデル+ハーネスのペアを世代ごとに鍛える再帰的自己改善ループの中身を追う。