JA EN

#sparse-attention

2 記事

01 ·推論・高速化·★ 会員·論文·13分で読めます 論文解説: Language Models Can Control Their Own Attention — モデルに「どこを見るか」を宣言させる Language Models Can Control Their Own Attention 長文脈のデコードでは、モデルは毎ステップKVキャッシュを丸ごと読み直している。Declarative Attention は、モデル自身に思考の中で「次はどこを見る」と宣言させ、推論エンジンがその宣言からアテンションマスクを作る。既製モデルにゼロショットで適用して注意トークンを52.0%/31.1%削減した論文を解説する。 02 ·Transformerの仕組み·★ 会員·論文·18分で読めます 論文解説: Qwen3.8-Next の設計 — 精度・効率・学習安定性を1つの問題として解く On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability Qwen3.8-Flash-Next の設計報告を1から読み解く。GDNハイブリッド、QSA、Gated Residual、N-gram埋め込みの4部品を、論文が使った「損失・コスト・安定性」の3軸で追う。