JA EN

#sft

4 記事

01 ·エージェント·★ 会員·論文·17分で読めます 論文解説: Terminal-Universe — エージェントの作業ログを、何度でも使える実行環境に戻す Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments エージェントの作業ログ(軌跡)に残ったファイル操作をリプレイし、欠けた部分を補完エージェントに埋めさせて実行可能なワークスペースを復元する枠組み。37.3kの環境を作り、Qwen3.5-27BのSFTでTerminal-Bench 2.1を+11.9ポイント改善した。 02 ·エージェント·★ 会員·論文·15分で読めます 論文解説: 良いエージェント学習データとは何か — ACE(正確さ・複雑さ・多様性)という見方 What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents エージェント用の学習データを (環境, タスク, 対話, 検証器) の4点セットとして捉え直し、生成を「正確さで通し、複雑さで置き、多様さで広げる」制約付き分布設計として整理したサーベイ論文の解説。 03 ·推論・高速化·★ 会員·論文·15分で読めます 論文解説: CyberFactory — 野生のCVEを「実行できる訓練問題」に変える CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild 実世界のCVEを実行・検証できるタスクへ変換し、再利用可能な「脆弱性解析スキル」で教師の軌跡を合成してモデルに内面化させるオープンソース基盤。CyberGymで Pass@1 58.1%。 04 ·エージェント·★ 会員·論文·17分で読めます 論文解説: FACET — 指示・環境・解答・採点を「同じ実行状態」に接地させる課題合成 FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis ターミナル課題は「指示文・環境・模範解答・採点器」の4点セット。FACETは環境を先に建てて動かし、その実現済み状態を全部品の共通の地面にすることで整合を取る。7万件のスキルから6,078課題を作り、1.2Kの成功軌跡だけでQwen3.5を4B/9B/27Bとも底上げした論文を1から解説する。