デイリーAIダイジェスト — 2026-09-09

公開

2026年9月9日

English · 日本語

arXiv ハイライト

On-Policy Reverse Distillationによる弱から強への汎化の引き出し

問題設定

Weak-to-strong (W2S) 汎化とは、より強力な student が、その supervisor として使用された弱い teacher を超えられるかを問うものです。これは実用上重要な問題です。base model が大型化するにつれ、世代ごとにフロンティアのpost-trainingをゼロから行い直したり、複数ドメインにわたる専門的な teacher を統合したりすることはコストが高くなります。標準的な distillation では teacher の出力をfitting targetとして扱うため、teacher の能力の上限が課せられます。RLVR(検証可能な報酬を用いたRL)はこの上限を回避しますが、サンプル効率が低い欠点があります。問いは、弱い teacher のpost-trainingシグナルを使って、その上限を引き継ぐことなく、student に対するverifier駆動のRLを加速する方法です。

手法

On-Policy Reverse Distillation(OPRD)は student に対して標準的なRLVRループを維持しつつ、student のロールアウト上で評価されたteacher のpolicy shiftを用いて、token levelのpolicy gradientを再スケーリングします。\pi_\theta を student とし、prefix s_t=(x, y_{<t}) においてサンプリング y \sim \pi_\theta(\cdot\mid x) を行うとします。advantage A_t および logits \mathbf{z}_t のもとで、RLVRのtoken gradientは

\mathbf{g}_t := A_t \nabla_{\mathbf{z}_t}\log \pi_\theta(y_t\mid s_t)

と定義されます。teacher は、student の prefix において評価された、自身の(RL前の)reference policyに対するlogit shiftを通じて介入します:

\bm{\Delta}_t := \mathcal{C}\!\left(\mathbf{z}_T(s_t) - \mathbf{z}_T^{\mathrm{ref}}(s_t)\right),

ここで \mathcal{C} は平均中心化を表します。\bm{\Delta}_t は、teacher のpost-trainingが進んだlogit空間上の方向です。ORDは \mathbf{g}_t のうち \bm{\Delta}_t と整合する成分を増幅させます。すなわち、verifier が支持し、かつteacherがすでに好むよう学習した更新がブーストされ、\bm{\Delta}_t に直交する成分はそのまま維持されます。

OPRDのtoken単位のgradient補正:中心化されたteacherとreferenceのlogit shift \bm{\Delta}_t を用いて、student ロールアウト上のverifier gradientの整合成分を再スケーリングする。

これにより2つの性質が導かれます:

  1. 再スケーリングはadvantage重み付き項のみを乗算するため、RLVRの目的関数の定常点は保たれます。verifier方向がゼロの場合はゼロのままとなり、student の漸近点はteacherではなくverifierとstudentのpolicy classによって決まります。
  2. すべてがon-policyです。teacherはstudentが生成したprefixに対してのみ問い合わせられるため、teacherの軌跡に対するSFTで生じるtrain–inference mismatchを回避できます。

teacherはGRPOでpost-trainingされた後に固定され、studentはOPRDで再スケーリングされたgradientを用いてGRPOスタイルのRLVRを実行します。

2つの評価設定:連続的なモデル転移(4B teacher → 8B student)とマルチドメイン統合。OPRDは両方においてbaselineを上回る。

結果

実験ではQwen3 4BおよびQwen3 8B(baseおよびinstruct)を使用し、数学タスクにDAP0-Math-17K、論理推論タスクに4種のReasoning Gym(Knights & Knaves、Quantum Lock、String Manipulation、Countdown)を用いています。teacherはGRPOでpost-trainingされた後に固定されます。AIME’24、K&K、String Manipulationで平均化した主要な4B-base → 8B-baseの比較結果は以下の通りです:

  • Teacher(4B post-GRPO):44.00
  • 初期8B-base student:13.21
  • Student + GRPO(teacher無し):45.44
  • OPD(標準on-policy distillation):45.67
  • W2SR-P(検証済みteacher軌跡に対するSFT):48.64
  • S2L-PO(混合off-policyなexplorerロールアウト):54.21
  • OPSD(teacherの軌跡をprivileged contextとして使用):21.69
  • Direct-OPD:37.81
  • W2S-OPD:49.22
  • OPRD:60.81

OPRDは最強のbaseline(S2L-PO)を平均6.60ポイント上回り、この評価スライスにおける全個別タスクで勝利しています。注目すべき点として、純粋なGRPO(45.44)がoff-policyなteacherデータを消費するほとんどのdistillation baselineに匹敵または凌駕しており、これはteacher出力を模倣しても根本的な能力は転移しないというGudibande et al. の観察と一致しています。純粋なGRPOに対するOPRDの優位性(+15.4ポイント)は、teacherをtargetではなく純粋に方向として使用することに由来します。

teacher checkpointの品質(GRPOステップ15/60/105/150)に関するablationでは、student のOPRDの曲線はteacher の強さとともに上昇しますが、studentは最終的に最も強いteacher checkpointをも超えます。これは定常点の議論を経験的に裏付けるものであり、teacher の品質は加速を制御するものであって、上限を決めるものではないことを示しています。

論文のSection 4における応答スタイル分析では、OPRDのstudentは最終的にteacherよりも純粋なRLVRモデルにスタイル的に近くなることが示されており、teacher shiftは模倣ターゲットではなくcurriculumシグナルとして機能することが示唆されています。

限界と未解決の問題

  • 全実験がQwen3ファミリー内で行われており、reference-policyのアラインメント \mathbf{z}_T^{\mathrm{ref}}(s_t) は teacher とstudent 間で共有またはそれに準ずるtokenizer/embeddingの幾何学的構造を前提としています。クロスファミリーの転移(例:LlamaのteacherからQwen studentへ)は未検証であり、\bm{\Delta}_t が異なるlogit空間に存在するため自明ではありません。
  • この手法はteacherとそのRL前のreferenceの両方へのアクセスを必要とします。これは社内での連続世代には容易ですが、APIのみのteacherへの利用は阻まれます。
  • 検証可能な報酬ドメイン(数学、記号的推論)のみが評価されています。「整合したverifier方向を増幅する」という手法がノイズの多い、あるいは学習された reward modelでも有効かどうかは未解決です。
  • 論文の抜粋では、token単位でのteacherとreferenceの追加forward passによるwall-clockやFLOPのオーバーヘッドが定量化されておらず、8Bスケールでは重要な問題です。
  • マルチteacher統合の結果は主張されていますが、提供されたセクションでは詳述されていません。競合する専門家からの \bm{\Delta}_t をどのように組み合わせるか(和、射影、ゲーティング)は設計上の課題です。

重要性

OPRDは弱いteacherによる監督を、distillation targetではなくgradient preconditionerとして再定式化します。teacherのpost-trainingベクトルをlogit空間に投影することで、studentの上限を制約することなく、studentのverifier駆動RLを加速します。これはモデルの世代間やドメイン間でpost-trainingを償却する洗練された方法であり、ゼロからのRLVRの繰り返しが支配的なコストになりつつある状況に正確に対応しています。

Source: https://arxiv.org/abs/2609.08798

DriveZero: 人間のデモンストレーションを超えたEnd-to-End運転

問題設定

模倣学習によって学習されたEnd-to-End運転ポリシーは、そのデモンストレーションログの行動カバレッジを引き継いでしまいます。稀なコーナーケース、分布外状態からの回復、専門家の軌跡に存在しない行動は、いずれも系統的に学習不足となります。DriveZeroは、模倣学習が混同している二つの問題を切り離すことで、この上限を突破しようとします。すなわち、世界を知覚する問題(表現の問題であり、大規模な視覚事前学習で最もよく解決される)と、世界の中で行動する問題(インタラクションの問題であり、closed-loop RLで最もよく解決される)です。それぞれが独自の学習体制のもとで事前学習され、その後distillationによってカメラのみのプランナーに統合されます。

概要: privileged RL teacher、VFM-distilledバックボーン、カメラのみのstudent。

DriveRL: スクラッチからのprivileged closed-loop RL

DriveRLは、模倣学習によるウォームスタートなしにランダム初期化からprivileged teacherを学習します。nuPlanログから構築された混合エージェントシミュレータ上でPPOを用います。各ステップtにおいてポリシーは構造化された観測O_tを入力として受け取ります。具体的には、5 Hzでサンプリングされたエゴと最大96の交通参加者の5フレーム分の情報、および交通信号状態が付与された最大256のローカルベクターマップトークンです。ナビゲーション意図は、エゴフレームにおける2つのgoalアンカーG_tとして表現されます。デプロイ時には、near/farアンカーが速度に応じたルックアヘッド距離でスケールされながら現在のルートに沿って配置され、毎ステップ再計算されます。同一の置換不変な2点表現が学習時とテスト時の両方で使用されます。

行動は連続値です。縦方向ジャーク\in [-8, 5]\ \mathrm{m/s^3}およびタイヤ操舵角速度\in [-0.8, 0.8]\ \mathrm{rad/s}であり、加速度は4\ \mathrm{m/s^2}、操舵角は\pi/3でキャップされています。ポリシーは正規化されたサポート(0,1)^2上のBeta分布を出力し、学習時はサンプリングを、評価時は解析的最頻値を使用します。アーキテクチャはコンパクトで、256次元トークン、4ヘッド、エゴ-エージェント間2層およびエゴ-マップ間1層のcross-attentionで構成されます。

混合エージェントシミュレータが重要なインフラの核心です。各バックグラウンドアクターはログリプレイ、ルールベースのIDMコントローラ、または学習済みポリシーのいずれかで駆動され、最大196,608のワールドが96 GPU上で並列に実行されます。学習は1ランクあたり2,048ワールド、5 Hzでの110ステップロールアウト、ログリプレイ/IDMシーン1:1混合、1更新あたり4 PPOエポック(\gamma=0.99)を使用し、2,400更新(壁時計時間約21時間)で行われます。報酬はハードイベント(安全違反、ゴール到達)とソフトな運転品質項を組み合わせています。ログはシーンとゴールのシードとしてのみ使用され、全ての学習経験はon-policyのインタラクションから得られます。

推論時には、学習済みcritic Vがvalue-guided test-time action searchを可能にします。複数のアクション候補をサンプリングし、各候補を短い horizon にわたってロールアウトし、短期報酬の和と終端のcritic値の合計でスコアリングし、候補が推定リターンを大幅に改善する場合は条件付きでポリシーのデフォルトアクションをオーバーライドします。

DriveVFM: マルチteacher視覚distillation

DriveVFMは、4つのフリーズされたfoundationモデル — DINOv3、SigLIP2、SAM、Depth Anything V2 — を、生画像のみからのfeature distillationによって単一の画像バックボーンに統合します。タスク固有のラベルは一切使用しません。その目的は表現にあります。すなわち、意味的同一性(SigLIP2)、密な自己教師あり構造(DINOv3)、セグメンテーション品質の境界(SAM)、およびメトリック深度(Depth Anything V2)を捉える特徴を1回のフォワードパスで得ることです。

パッチ特徴のPCAおよび地面類似度。DriveVFMはDINOv3単体と比較して障害物のコントラストを鮮明にする。

可視化結果は、DriveVFMがDINOv3特徴単体と比較して、走行可能な路面と長テール障害物(囲み領域)の間においてより明確な分離を生じさせることを示しています。マルチteacherの組み合わせにより、DINOv3の空間的一貫性を保持しつつ、プランニングに有用な深度・意味的識別性が付加されています。

DriveZero: trajectory distillationによる統合

privileged DriveRL teacherからカメラのみのDriveZero studentへのwinner-takes-all distillation。

カメラのみのstudentは、DriveVFM特徴とコマンド条件付きTransformerプランナーを使用し、複数の20ステップ軌跡提案を出力します。Teacherはprivileged状態から20ステップの参照軌跡をロールアウトします。教師信号はwinner-takes-all(WTA)です。teacherの軌跡に最も近いstudentの提案のみが回帰勾配を受け取ることで、studentは平均への崩壊を避けてマルチモーダルな提案分布を維持できます。追加の信号として、提案スコアリング(teacherのcriticがstudentの提案をランク付けし、価値情報を離散的なスコアリングヘッドに転送する)と、行動カバレッジを広げるために2点ゴールを変化させるgoal-conditioned augmentationが含まれます。

結果

DriveRLはnuPlan上でclosed-loopで評価され、DriveZeroはNAVSIMv1、NAVSIMv2、およびHUGSIM上でカメラのみのプランナーとして各ベンチマークの標準センサープロトコルに従って評価されます。記載されているセクションは評価マトリックスを列挙していますが、数値テーブルはここには含まれていません。具体的に明示されている学習側の数値は以下の通りです。10 Hzで41フレームの履歴/200フレームの未来を持つ922,703のnuPlan trainvalシーン、5 Hzの実効学習レート、196,608の並列ワールド、96 GPU、収束まで21時間です。

限界とオープンクエスチョン

Teacherはprivilegedな構造化状態(完全なトラッキング、HDマップ、交通信号フェーズ)に基づいて動作しますが、studentはカメラ画像のみから同等の行動を復元しなければならず、このdistillationステップにおけるsim-to-realギャップが自然な失敗モードとなります。teacherの軌跡へのWTA回帰は、teacherの判断を実行不可能にする知覚誤りを修正しません。混合エージェントシミュレータはバックグラウンドアクターにログリプレイまたはIDMを使用しますが、いずれも強い反事実的なエゴ行動に対してリアルに反応しないため、RLポリシーが受動的なリアクティブ交通を悪用する可能性があります。報酬シェーピングはハードな安全イベントとソフトな品質項を組み合わせていますが、結果として得られるポリシーが境界線において快適性と進行をどのようにトレードオフするかはレポートで詳述されていません。最後に、DriveVFMはダウンストリームのプランニングを通じてのみ評価されているため、改善のどれだけが表現的なものによるものか、distillation正則化によるものかは不明です。

なぜ重要か

closed-loop RLが人間のログの行動エンベロープを超える運転teacherを生成できるならば、そしてそのteacherがフリーズしたVFM特徴上でのWTA trajectory supervisionによってカメラのみのstudentにdistillできるならば、人間の軌跡の模倣はもはやEnd-to-End運転の上限ではなくなります。privileged状態でのRL、センサーへのdistillationというアーキテクチャは、ロボティクスやゲームで機能してきたアプローチを反映しており、本研究はそれをnuPlan/NAVSIMスケールで機能させるための本格的な試みです。

Source: https://arxiv.org/abs/2609.06055

BeaconKV: 効率的な大規模推論モデル推論のためのBeaconクエリによるKey-Valueキャッシュ圧縮

問題

大規模推論モデル(LRM)はChain-of-Thoughtのトレースを生成し、KVキャッシュがシーケンス長に対して線形に膨張するため、数万トークン規模のトレースでは急速にGPUメモリを超過します。既存の退避スキーム(SnapKV、RPC、R-KV)は、最近のクエリ Q_{\text{obs}}(通常は末尾の16〜32トークン)のウィンドウからトークンの重要度を推定しており、暗黙的に「最近のクエリは将来のattentionの信頼できる代理変数である」と仮定しています。著者らは、この仮定が長いホライズンの推論において、彼らが「Thought Revisiting Tokens(TRT)」と呼ぶ現象によって成立しないことを示しています。TRTとは、デコードステップのクエリが局所的な近傍ではなく、問題文・計画・制約といった遠く離れた初期コンテキストへと跳び戻るトークンのことです。

観察:TRTとその幾何学的構造

著者らは、クエリを局所的なもの(主に近傍のキーにattendする)と大域的なもの(現在の位置から遠いキーにattendする)に分類しています。Figure 1(a)は、代表的なheadにおいて、1066〜1092のウィンドウ内のほとんどのクエリが900〜1092の範囲のキーにattendする一方で、トークン1068と1090が100〜450付近のキーへattentionを向けていることを示しています。Figure 1(b)は、クエリとその上位Kのattend先キーとの位置差であるattention距離の分布をプロットしており、局所的(ゼロ付近に集中)クエリと大域的(広く長距離にわたる)クエリの間に明確な双峰性の分離があることを示しています。

局所的クエリと大域的クエリを示すattention重みおよびattention距離の分布。

重要なことに、TRTは単一のlayerやheadに限定されません。Figure 3は、R1-Distill-Qwen-7BによるAIME24のsample-0において、出力位置512〜639における全layer・head上での大域的クエリの出現回数を集計しており、大域的クエリがネットワーク全体に散在していることが明らかになっています。

layer・head全体における大域的クエリの出現状況。

重要な洞察は幾何学的なものです。大域的クエリは予測不可能なタイミングで出現しますが、TRTを引き起こすクエリは、RoPE適用前のクエリ空間において少数の類似グループにクラスタリングされます。Figure 4(a)はデコード区間内のクエリ間のコサイン類似度を示しており、Figure 4(b)は平均類似度が低い(大域的な)クエリがPCA射影においていくつかの密なクラスタに落ちることを示しています。これは、少数の代表的な「beacon」クエリが、将来の大域的なattentionパターンの全体を近似できることを意味しています。

クエリ間のコサイン類似度と、低類似度(大域的)クエリのクラスタ構造を示すPCA。

手法:BeaconKV

BeaconKVはtraining-freeです。定期的な退避を行い、キャッシュが予算 B_{\text{KV}}^{\max} に達するたびに、トークンをスコアリングして B_{\text{KV}}^{\min} = \tfrac{7}{8}B_{\text{KV}}^{\max} まで退避させます。すなわち、コンパクション1回あたり \tfrac{1}{8}B_{\text{KV}}^{\max} 分の出力トークンが削除されます。

新規性は観測セットにあります。標準的な手法は Q_{\text{obs}} を末尾の約32クエリのみから構成しますが、BeaconKVはこれをbeaconクエリで拡張します。beaconクエリとは、RoPE適用前の空間で過去のクエリをクラスタリングすることで得られるコンパクトな代表集合です。キャッシュされたKVペアの重要度スコアは、結合集合 Q_{\text{obs}} = Q_{\text{recent}} \cup Q_{\text{beacon}} に対して計算されます。beaconが過去の大域的クエリの幾何学的構造を要約しているため、将来のTRTデコードステップ(例:初期計画をエンコードするトークン)によって再訪される可能性の高いKVペアは高いスコアを受け取り、最近のクエリが現在それらにattendしていない場合でも退避を免れます。

具体的には、最近のクエリ予算は16トークンに固定され、beaconクエリ予算は16〜32トークンの間で変化します。クエリ履歴をそのまま保存するのではなくクラスタリングによって圧縮するため、beaconを維持するオーバーヘッドは有界です。

結果

評価は、4つのLRM(R1-Distill-Qwen-7B、R1-Distill-Llama-8B、Qwen3-4B、Qwen3-14B)を対象に、AIME24(8回実行の平均pass@1)、MATH-500、LiveCodeBench、GPQA-Diamond(4回実行の平均)で行われており、生成は32,768トークン上限、p=0.95、temperature 0.6 に設定されています。ベースラインはSnapKV、RPC、R-KVであり、いずれも同じ B_{\text{KV}}^{\max} 退避スケジュールのもとで比較されています。

論文はBeaconKVがモデルおよびベンチマーク全体でベースラインを「概ね上回る」と報告しています(提供されたテキストではabstractが具体的な数値の前で切れています)。beaconによって Q_{\text{obs}} を拡張することで推論にとって重要な初期トークンが保持されるという機械論的な主張は、最近のクエリのみの観測ウィンドウがTRTの再訪先となるKV位置を系統的に見逃すことを示した先の分析によって直接的に裏付けられています。システム面では、ピークGPUメモリの削減とスループットの改善が影響として述べられていますが、正確な比率は提供されたセクションには含まれていません。

限界と未解決の問題

  • 大域的クエリのクラスタリングはR1-Distill-Qwen-7Bの特定のhead(layer 18、head 16)で実証されており、クラスタ数と安定性が全headや他のモデルファミリーに対してどの程度一般化するかは、定性的(Figure 3)に特徴付けられているものの、クラスタ品質メトリクスによる検証は行われていません。
  • beaconの選択はRoPE適用前の空間で行われますが、将来のデコードステップでbeaconを再利用する際のRoPEベースの位置エンコーディングとの相互作用は、感度が分析されていない非自明な設計上の選択です。
  • 評価は、32,768トークン上限の推論ベンチマーク上のオープンソースLRMに限定されています。はるかに長いトレース、エージェント的なワークロード、あるいは非推論の長コンテキスト生成(検索拡張QA、コードリポジトリ)における挙動は未検証です。
  • コンパクションスケジュール(各トリガーで \tfrac{1}{8} を退避)は固定されており、推論フェーズ(計画・実行・検証)への適応性は探索されていません。

この研究の意義

BeaconKVは、KV退避を「クエリ分布のモデリング問題」として再定式化します。最近のクエリが将来のattentionを予測すると仮定するのではなく、過去のクエリ空間におけるクラスタから将来のクエリの幾何学的構造を推定します。これは、計画や制約への長距離の再訪という障害モードに対する原理的な修正であり、この障害モードは推論トレースがコストに影響するほど長くなるときにまさに支配的になります。

Source: https://arxiv.org/abs/2609.04971

Kalman Delta Networks: 不確実性を考慮した連想記憶

問題

Linear-attention の各変種(DeltaNet、Gated DeltaNet、KDA)は、固定サイズの再帰的メモリ \boldsymbol{S}_t \in \mathbb{R}^{d_k \times d_v} を保持し、連想マップ \mathcal{M}_t(\boldsymbol{k}) = \boldsymbol{S}_t^\intercal \boldsymbol{k} を実装しています。各トークンにおいてモデルは、既存のキー・バリュー結合をどの程度強く上書きするかを決定しなければなりませんが、その判断は現在の embedding のみに基づいており、近傍のキーに対してメモリがすでに格納している値にどの程度確信を持っているかという表現を持ちません。これは誤った帰納バイアスです。メモリがすでに十分な情報を持っている場合には、強く冗長な書き込みは割り引かれるべきであり、不確実性が高い場合には新規の書き込みが増幅されるべきです。Delta スタイルの更新ではトークンごとのスカラーを代替として使用していますが、蓄積された証拠を追跡することはありません。

手法

KDN は、再帰的メモリを潜在マップ \widetilde{\boldsymbol{S}}_t に関する線形ガウス状態空間モデルとして再定式化します:

\widetilde{\boldsymbol{S}}_t = \boldsymbol{D}_t \widetilde{\boldsymbol{S}}_{t-1} + \boldsymbol{W}_t,\quad \boldsymbol{W}_t \sim \mathcal{N}_{\mathrm{col}}(0, \boldsymbol{\Omega}_t),\qquad \boldsymbol{v}_t = \widetilde{\boldsymbol{S}}_t^\intercal \boldsymbol{k}_t + \boldsymbol{e}_t,\ \boldsymbol{e}_t \sim \mathcal{N}(0, r_t \boldsymbol{I}_{d_v}).

DeltaNet は \boldsymbol{D}_t = \boldsymbol{I}、Gated DeltaNet は \boldsymbol{D}_t = \alpha_t \boldsymbol{I}、KDA は \boldsymbol{D}_t = \operatorname{diag}(\boldsymbol{\alpha}_t) に対応しており、いずれも共分散の追跡は行いません。Kalman filter はこのモデルに対して最適であり、平均 \widehat{\boldsymbol{S}}_td_k \times d_k の予測共分散 \widehat{\boldsymbol{P}}_t の両方を伝播させ、ゲイン

\boldsymbol{\kappa}_t = \frac{\widehat{\boldsymbol{P}}_t \boldsymbol{k}_t}{r_t + \boldsymbol{k}_t^\intercal \widehat{\boldsymbol{P}}_t \boldsymbol{k}_t}

による残差書き込みを適用します。

障害となるのは、正確な事後分布 \boldsymbol{P}_t^\star = (\widehat{\boldsymbol{P}}_t^{-1} + \boldsymbol{k}_t \boldsymbol{k}_t^\intercal / r_t)^{-1} が Riccati 漸化式に従い、状態依存かつ密であり、GPU 並列学習に必要な associative-scan の形式 \boldsymbol{S}_t = \boldsymbol{A}_t \boldsymbol{S}_{t-1} + \boldsymbol{b}_t と非互換である点です。本論文では、scan と互換性のある二つの近似手法を導入します。

Diagonal KDN。 \boldsymbol{P}_t, \boldsymbol{D}_t, \boldsymbol{\Omega}_t を正の対角行列に制限します。予測ステップは対角族を保ちます:

\widehat{\boldsymbol{p}}_t = \boldsymbol{\alpha}_t^2 \odot \boldsymbol{p}_{t-1} + \boldsymbol{\omega}_t,\qquad \boldsymbol{\kappa}_t = \frac{\widehat{\boldsymbol{p}}_t \odot \boldsymbol{k}_t}{r_t + \sum_i \widehat{p}_{t,i} k_{t,i}^2}.

ランク1更新によって対角性が失われるため、各トークンの後に正確な事後分布 (\boldsymbol{S}_t^\star, \boldsymbol{P}_t^\star) を逆 KL 最小化によって対角ガウス族に射影します。この射影は平均を保存し、不確実性に対して閉形式の Möbius マップを与えるため、associative scan が O(d_k) の補助状態でヘッドあたり対数並列深さで実行できます。

Kalman Associative Memory 更新の1ステップと Diagonal KDN の平均場変分近似。

Isotropic KDN。 \boldsymbol{P}_t = p_t \boldsymbol{I} と崩約し、ヘッドあたり単一の不確実性スカラーで十分とします。漸化式は再び O(1) の補助状態を持つ Möbius マップになります。

両変種は、予測共分散がトークンごとの等方的代替に置き換えられ、共分散が持ち越されない退化ケースとして Delta スタイルの更新を回復します。重要なのは、各キーチャンネルへの書き込み強度が現在のトークンの関数のみではなくなることです。つまり、キー空間のその方向をどれだけの証拠がこれまでに制約してきたかを追跡する \widehat{\boldsymbol{p}}_t によって変調されます。

Kalman Delta Network のアーキテクチャ。

結果

モデルは FineWeb-Edu 上で、GDN-2 の制御されたプロトコルに従い、バックボーン・optimizer・データを各 mixer 間で固定した状態で、二つの対応するスケール(750M パラメータ/500億トークンおよび 1.3B パラメータ/1000億トークン)で事前学習されています。評価は、perplexity(WikiText、LAMBADA)、ゼロショット常識推論(LAMBADA、PIQA、HellaSwag、WinoGrande、ARC-Easy、ARC-Challenge)、合成長文脈検索(RULER シングルおよびマルチキー NIAH)、および JRT 方式のクローズ形式実世界検索(SWDE、SQuAD、FDA、TriviaQA、NQ、DROP)をカバーしています。

アブストラクトでは「KDN の各変種は、両スケールにわたって最先端の linear-attention モデルと比較して perplexity および平均下流精度を一貫して改善する」と報告されています。提供されているセクションでは数値の差分が列挙されていないため、WikiText/LAMBADA perplexity および RULER/JRT 検索における具体的な改善幅は結果表へのアクセスなしには引用できません。比較ベースラインは DeltaNet、Gated DeltaNet、KDA、および GDN-2 です。

限界と未解決の問題

二つの近似は一つのスペクトルの両端に位置しており、どちらも本フレームワークが最適と特定する密な \boldsymbol{P}_t^\star を追跡しません。逆 KL 射影は平均を保存しますが、相関するキーに関する証拠を正確に運ぶチャンネル間の不確実性構造を破棄します。観測ノイズスカラー r_t とプロセスノイズ対角 \boldsymbol{\omega}_t はトークンごとに学習され、これらの償却されたノイズ予測が真にベイズ的な処理をどの程度近似しているかは本論文の枠組みでは解決されていません。より大きなスケールや長期学習でも改善が持続するかどうか、および構造化(例:低ランクプラス対角)共分散近似が scan と互換性を持てるかどうかは、自然な次の問いです。等方的なヘッドはチャンネルごとの証拠追跡を完全に失うため、その貢献は方向的な不確実性よりも原理的なゲインスケジューリングから主にもたらされると考えられます。

なぜこれが重要か

再帰的 linear-attention メモリはアドホックな書き込み強度のヒューリスティックに収束してきましたが、KDN の構成は、DeltaNet・Gated DeltaNet・KDA がいずれも単一の Kalman 漸化式の固定ゲイン退化であることを示しています。そして欠けていた要素、すなわちメモリと共に持ち越される共分散を、これらのモデルをスケールで学習可能にする associative-scan 特性を壊すことなく再導入できることを示しています。

Source: https://arxiv.org/abs/2609.07816

NeoHorse-1: Routing Harnessを用いたAgentic Post-Trainingによる再帰的自己改善に向けて

問題設定

再帰的自己改善(RSI)は通常、抽象的なループとして議論されます。すなわち、システムが自身の能力を測定し、その測定結果を学習シグナルに変換するというものです。NeoHorse-1はこのループを具体化し、デプロイメント時のrouting harness自体をセンサーとして機能させることを提案しています。ユーザーの各ターンは、(i) 予測された能力要求、(ii) 異種モデルプールから選択されたサービス階層、(iii) 結果として得られるインタラクション軌跡という3つの情報を生成します。これらの記録は構造化されたadmissionパイプラインを通じて学習サンプルに変換され、supervised fine-tuning(SFT)およびon-policy distillationのカリキュラムにフィードバックされます。そのカリキュラムの混合比は評価フィードバックに基づいて再重み付けされます。この手法により、データ混合レベルで評価–選択–更新ループが閉じられ、agentic post-trainingに自己改善の機械的に定義されたアナログが与えられると主張しています。

データパイプライン

Post-trainingデータは3つの粒度で整理されています。軌跡(ツール呼び出し、観測、回復試行、終端結果を含むharness実行全体)、ユーザーターン(あるユーザーリクエストから次のユーザーリクエストまで;SFTの基本シリアル化単位)、およびsubscene(ローカルな目標を共有する隣接ターンの連続;意味的な単位)です。

ターンレコード内では、現在のリクエストと、推論・ツール呼び出し・観測のインタリーブされたストリームがすべて保持されるため、推論–行動–フィードバックの連鎖が教師情報として維持されます。以前のターンはコンテキストとして保持されますが、その推論トレースは削除されます。これはマルチターン推論データに対するDeepSeek-R1およびQwenのレシピと類似したトレードオフです。各レコードは親となる軌跡およびsubsceneへのリンクを保持しており、品質・意味・ルーティング・結果のシグナルを適切な粒度で結合できます。

Subsceneレベルのシナリオ特性化:軌跡は順序付けられたイベントストリームであり、ローカルな目標を共有する隣接ユーザーターンがsubsceneを形成し、Scene・Goal・Outcomeの視点から記述される。

Admissionは3段階で実行されます。構造的検証、6次元の意味的評価、およびsubsceneレベルのラベリングです。規模は 10^{5}10^{6} のharness生成軌跡であり、公開されている指示・推論・ツール使用・コード・エージェントインタラクション・preferenceデータで補強されます。学習マニフェストは、統一シリアル化、重複排除、およびtokenizerの固定後に N_{\mathrm{traj}}N_{\mathrm{tok}} を記録します。

Agentic SFTおよびrouting-guided distillation

教師あり学習はinterleaved thinkingパターンに従います。ユーザーターンにはツール結果を挟んだ複数のアシスタント応答が含まれる場合があり、モデルは可視の履歴を条件として、単一シーケンスに連結された保持済みアシスタントターゲットスパン上で学習されます。ツール結果およびharness注入メッセージは新しいターンを開かないため、lossはポリシー自身の出力のみに整合します。

ルーティングメタデータ(予測された能力要求と選択されたサービス階層)は単なるフィルタではなく、学習を構造化します。SFTはこれらのルーティングシグナルによって順序付けられた3段階のカリキュラムとして実行され、同じ進行がrouting-guided on-policy distillationにも拡張されます。ここでは教師が各カリキュラム段階内で生徒の生成した応答を監督します。Capability-guided allocationは能力軸ごとの評価結果を読み取り、次ラウンドの学習混合比を再構成することで、性能が低い能力により多くの次の混合が割り当てられます。これが本論文の主張するRSIループの機械的な形式です。すなわち、評価 → 能力選択 → 混合更新 → 再学習というループです。

結果

NeoHorse-1は4Bおよび9Bスケールでリリースされ、3グループ11のベンチマークで評価されています。

  • Agentic(エンドツーエンド): QwenClawBench、WorkBuddy Bench、PinchBench、VitaBench。
  • Agentic(ツール使用・マルチターン): BFCL V4、\tau^{2}-Bench(Airline、Retail、Telecom)。
  • Coding: HumanEval、LiveCodeBench v6。
  • Instruction following: IFEval、IFBench。

本論文は、固定モデルスケールでのagentic post-trainingによる一貫した性能向上、および3カテゴリ全体にわたる9Bの4Bに対する追加の改善を報告しています。26クリックの囲碁盤再現という印象的な定性的デモンストレーションがあります。同一のharness駆動UIインタラクション後、ベースのQwen3.5-9Bは盤を空のままにする一方、NeoHorse-1-9Bは13個の黒石と13個の白石を持つ対局中の正確な局面を正しくレンダリングしました。これにより、agentic supervisionの貢献が孤立した推論ではなく、制約追跡と実行検証にあることが明確になります。

同一の26クリック再現後、Qwen3.5-9B(左)はページを空白のまま残すが、NeoHorse-1-9B(右)は対局中の局面に13個の黒石と13個の白石を表示している。

軌跡ソースと教師あり学習スケールに関するアブレーションにより、harness生成インタラクションデータの構成と量が下流の性能にどう関係するかが特性化されています。ただし、上記の抜粋には正確なスケーリング係数は報告されていません。

制限と未解決の問題

いくつかの主張は精査に値します。第一に、「再帰的」ループは真の自己プレイや自己蒸留の固定点のようなパラメータ更新レベルではなく、混合割り当てレベルで閉じられています。繰り返しの反復が継続的に性能向上をもたらすのか、それとも1〜2ラウンドで飽和するのかは、抜粋では確立されていません。第二に、6次元の意味的評価とcapability-guided allocatorはそれ自体がモデルであり、パイプラインはそれらが持つバイアスを混合に引き継ぎます。第三に、コンテキストから以前のターンの推論を削除することは、特に長い軌跡においてモデルがマルチステップ回復を学習できるホライズンを制限する可能性があります。第四に、マッチしたコンピュートでの強力なagentic baselineとの比較は提供されたセクションに詳述されておらず、例えばQwen3でfine-tuningされたエージェント変種に対する相対的な性能向上はここでは定量化されていません。最後に、harness生成軌跡はharnessがすでに行うルーティング決定に対してon-distributionであり、ルーター自体が更新される場合には分布シフトの懸念があります。

重要性

routing harnessがデプロイメントメカニズムと自己教師あり能力プローブの両方として機能できるならば、エージェントのpost-trainingは静的コーパスの問題ではなく閉ループデータの問題となります。この再フレーミング、すなわち能力評価が次の学習混合を直接パラメータ化するという考え方は、これまで概念的に留まっていたRSIの物語を、具体的かつ監査可能な形で実現するものです。

Source: https://arxiv.org/abs/2609.08183

AuK テクニカルレポート:音声生成・編集のためのオープンソース基盤モデル

問題設定

既存のオープン音声モデルは専門化されており、ゼロショット TTS、指示ベース TTS、デノイジング/分離、コンテンツ編集、パラ言語的・音響的編集はそれぞれ互換性のないインターフェースを持つ独立したシステムとして構築されるのが一般的です。AuK はこれらを単一のコンディショニングプロトコル——自然言語による指示とオプションの音声コンテキスト——のもとに統合し、一つのモデルでそれらすべてをカバーするよう学習させます。対象とするスコープは、音声生成、コンテンツ編集、パラ言語的編集、音響編集、強調/分離の五つのタスクファミリーです。

AuK がカバーする能力の概要

データ

事前学習コーパスはおよそ 3.03 \times 10^9 件の指示–音声インスタンスからなり、有効な監督時間の合計は 1.95 \times 10^6 時間に達し、上記五つの能力ファミリーに従って整理されています。

能力ファミリーごとに整理された事前学習コーパス

ゼロショット TTS については、著者らは参照トランスクリプトの要件を明示的に排除しています:話者が n 発話を持つ場合、\binom{n}{2} 個の順序なしペアをすべて列挙し、各発話をプロンプトとターゲットとして交互に使用することで n(n-1) 個の双方向インスタンスを生成します。プロンプトの波形とターゲットテキストのみが与えられ、プロンプトのトランスクリプトは一切使用されません。これにより推論時の ASR 依存が排除され、任意のクロップからのクローニングが可能となります。コーパスは音源分離、MOS フィルタリング、話者照合、マルチ ASR クロスバリデーションによってクリーニングされています。

アーキテクチャ

AuK は三つのモジュールから構成されます。

  1. 指示(および存在する場合は音声)を受け取り、意味的条件を生成するマルチモーダル LLM。意味的条件は最終隠れ状態ではなく、LLM の層ごとの隠れ状態に対する学習可能な重み付き和として求められます。
  2. 音声、一般音響、音楽を対象として共同学習された VAE で、音響的 latent を生成します。エンコーダは 24 kHz モノラルに対して動作し、ストライド (2,2,2,3,4,5) を持つ六つのダウンサンプリングブロック、チャンネル幅 12{\to}24{\to}48{\to}96{\to}192{\to}384{\to}768、カーネルサイズはストライドの二倍、ダイレーション (1,2,4,8,16,32) を持つ残差ユニットを採用しており、総ダウンサンプリング係数は 480、50 Hz の latent フレームレート、64 次元の posterior を実現します。四層の結合型 normalizing flow \mathcal{F}\mathbf{z}_p = \mathcal{F}(\mathbf{z}) を正則化しますが、これは VAE 学習時のみ適用されます。BigVGAN スタイルのデコーダはストライド (5,4,3,2,2,2) の転置畳み込み、AMP モジュール、SnakeBeta 活性化関数を使用し、3 フレームの先読みを経てカーサル(因果的)な構造となっています。
  3. FLUX スタイルのハイブリッド rectified-flow Transformer:意味的トークンと音響トークク間で joint attention を行いながらストリーム固有の残差を保持する M 個の dual-stream MMDiT ブロック、続いて連結されたシーケンス上で動作する N 個の single-stream DiT ブロックから構成されます。

二つのコンディショニング方式は統一的に扱われます。参照音声がある場合(ゼロショット TTS、コンテンツ編集、強調、分離)、同一の波形が MLLM 音声エンコーダと VAE エンコーダの両方に入力され、参照 latent はノイズ付きターゲット latent とシーケンス軸方向に連結されます。参照音声がない場合(指示 TTS)、音響ストリームはノイズ付きターゲットのみとなります。いずれの場合も、transformer はデノイズされた latent を予測し、それを VAE がデコードします。

学習と高速化

事前学習はステージ制で実施されます:生成のみのウォームアップ、その後生成と編集の共同学習。ポスト学習はタスクごとに分かれており、オープンエンドな編集については人間フィードバックによる preference optimization、音声生成については報酬ベースの RL を使用します。

AuK-Flash は、ポスト学習済み教師モデルから蒸留された、四ステップ・CFG フリーの student モデルです。Stage 1 は consistency initialization:隣接するタイムステップ t < t' に対して教師が CFG ガイド付きの velocity ステップ一回で \mathbf{z}_t\mathbf{z}_{t'} に移動させ、student は予測エンドポイント \hat{\mathbf{z}}_1(\mathbf{z}_t)\hat{\mathbf{z}}_1(\mathbf{z}_{t'}) が一致するよう学習されます(後者には stop-gradient を適用)。著者らは、更新回数を揃えた条件下で consistency initialization が ODE regression(CausVid)および MeanFlow を上回ることを報告しています。Stage 2 は、分布マッチング下での分離能力を保持するためにタスク別ルーティングを用いた Decoupled DMD です。フロントエンドの Prompt Enhancer が自由形式のクエリを処理します:入力音声に対して ASR を実行し、LLM を使用してタスクと引数を特定し、話速・音量・ピッチの連続的な記述を対応するビンに量子化し、標準的な指示テンプレートにレンダリングします;標準的な指示は PE をバイパスできます。

結果

Seed-TTS-Eval、InstructTTSEval、MMAE-Speech における WER/SIM/EMR の比較

Seed-TTS-Eval(英語/中国語/中国語-難/平均)では、AuK は WER 1.02/1.02/5.91/2.65 を達成し、Qwen3-TTS の 1.23/1.22/6.76/3.07 および Seed-TTS の 2.25/1.12/7.59/3.65 を上回りました;AuK-Flash は 1.03/1.10/6.43/2.85 です。SIM については、AuK 0.788/0.814/0.782/0.795 が Seed-TTS の 0.762/0.796/0.776/0.778 を上回りました。InstructTTSEval DSD-ZH/EN では、AuK は 83.37/81.60(ZH で最高);Qwen3-TTS-VD が EN で 82.40 でトップとなり、AuK-Flash と並んでいます。

MMAE-Speech では、AuK は IFR/CR/EMR 48.23/88.11/12.44 を達成し、Step-Audio-EditX の 43.52/77.27/4.69 を上回りました;AuK-Flash は 46.62/86.41/13.85(EMR 最高)です。SpeechEditBench(コンテンツ/感情/韻律/パラ言語的/音響精度)では、AuK は 91.83/9.94/71.33/38.50/37.07 であり、Ming-UniAudio の 76.46/3.43/26.50/11.25/25.85 および Step-Audio-EditX の 16.50/7.71/20.13/31.25/22.89 と比較して、コンテンツ、韻律、音響編集において大きな差を示しましたが、感情精度は絶対値として依然低い水準にとどまっています。Ming-Freeform-Audio-Edit の意味的編集では、AuK は全セットの WER を ZH/EN で 3.09/3.96 に削減し、Ming-UniAudio の 10.46/14.28 から大幅に改善されており、SIM はおよそ 0.88 です。

強調/分離については:DNS Challenge では、AuK は dWER 2.66、SIM 0.99 を達成し、RE-USE の 3.31/0.98 を上回りました;CHiME-4 では WER 7.98 対 RE-USE 10.71;Libri2Mix では WER 9.12、SIM 0.96 で、汎用モデルであるにもかかわらず専門モデル MossFormer2-SS(9.34/0.96)と競合する結果となっています。

限界と未解決の問題

SpeechEditBench における感情編集精度は AuK で 9.94、AuK-Flash で 6.29 と低く、コンテンツや韻律を大きく下回り、失敗モードの分析もなされていません。パラ言語的精度 38.50 も同様に控えめな水準です。Libri2Mix では専門モデル MossFormer2-SS が依然として AuK に並ぶ結果であり(WER 9.349.12 は僅差ですが、Flash は 10.07 に後退しています)。本レポートでは、各ファミリーに対して RLHF と SFT がどれほど寄与しているか、またトランスクリプトフリーのゼロショット手法が短いプロンプトのクローニングにおいてトランスクリプト条件付きベースラインと比べて不利かどうかについては定量化されていません。計算量、VAE 再構成の数値、完全なアブレーションは付録に委ねられています。

重要性

MLLM による意味的コンディショニングと音声/音響/音楽の VAE を共同学習した単一の rectified-flow バックボーンが、TTS、編集、強調、分離にわたる専門システムに匹敵あるいは凌駕する性能を示し、大部分の性能を維持する四ステップ CFG フリーの蒸留モデルも実現されています。著者らの主張通りに重みが公開されれば、これまで独立して存在していた複数のオープンソーススタックが一つに集約されることになります。

Source: https://arxiv.org/abs/2609.08936

OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining

問題

World-Action Models(WAMs)は、大規模な映像生成モデルが蓄積した視覚的な世界知識を再利用し、身体的制御に応用しようとするものです。そのアプローチは魅力的です。映像の diffusion モデルや自己回帰モデルは、原理的に物理法則・物体永続性・アフォーダンス・多段階ダイナミクスを学習しており、そのモデルを固有受容感覚で条件付けしてアクションに変換できれば、遠隔操作デモンストレーションのデータ予算をはるかに超えた汎化能力を持つコントローラが得られます。

実際上の問題は、公開されているWAMシステムがモノリシックであることです。生成バックボーン、視覚トークナイザーまたは潜在空間、action head、世界予測とアクション予測の間の情報フロー、denoising・推論スケジュール、そして事前学習の混合データ比率が、すべて統合的に設計・学習されています。報告された性能向上は多くの独立した設計選択を混在させており、チーム間での再現性は低い状況です。次のどの要素が実際に重要なのかが不明確です:継承するバックボーン、使用する潜在表現、世界とアクションがパラメータを共有するか否か、denoising が同時か逐次か、必要な身体的データ量はどれほどか。

OpenWAMは、設計空間を因子分解して共通基盤上でマッチしたアブレーションを実行することで、この状況を管理された実験プログラムに変換しようとする試みです。

手法

このシステムは2つの層から構成されます。OpenWAM-Infraは、WAMの学習を統一的な学習・推論・デプロイメント・評価を備えた組み合わせ可能なモジュールに分解するエンジニアリング基盤です。具体的には、この因子分解により以下の独立したスロットが露出されます:(i) 生成バックボーン(映像 diffusion / masked video モデル / スケールを変えたAR映像モデル)、(ii) 視覚潜在空間(VAE圧縮率、離散 vs 連続、トークン数)、(iii) action head(独立モジュール vs 共有トランク;パラメータ容量)、(iv) 世界からアクションへの情報フロー(cross-attention、特徴連結、KV共有、またはなし)、(v) denoising スケジュール(世界トークンとアクショントークンに対する独立・逐次・同期同時 denoising)、(vi) データカリキュラム(映像のみ事前学習、身体的データのみ、混合、段階的 vs 一段階同時学習)。

形式的に、WAMは履歴 h とゴール g を条件として、将来の観測潜在変数 z_{1:T} とアクション a_{1:T} の同時分布を定義します。OpenWAMは、共通のノイズスケジュールを持つ連結変数 x_t = [z_t, a_t] 上の diffusion プロセスとしてこれをパラメータ化し、学習 loss は次式となります。

\mathcal{L} = \mathbb{E}_{t,\epsilon}\big[ \lVert \epsilon^z - \hat{\epsilon}^z_\theta(x_t, t, h, g)\rVert^2 + \lambda \lVert \epsilon^a - \hat{\epsilon}^a_\theta(x_t, t, h, g)\rVert^2 \big],

ここで \lambda は action head の重み付けを制御します。アブレーションでは、これを (a) 逐次因子分解 p(z_{1:T}|h,g)\,p(a_{1:T}|z_{1:T},h,g)、(b) クロスフローのない独立 denoising、(c) 共有トランク vs 専用アクション容量のバリアントに置き換えます。

OpenWAM-Study はこの基盤を用いて3つの問いに取り組みます:どのような上流シグナルが転移するか、世界とアクションの学習がどのように相互作用するか、そしてそれらの相乗効果がどのようにスケールするか。

知見

本論文は3つの実証的な原則を導き出しています。

  1. 何を継承すべきか。 上流の知識が転移するのは、(a) 十分に高い能力を持つ生成バックボーンと、(b) コンパクトで情報豊富な潜在空間を通じてのみです。小規模なバックボーンや過度に高次元な pixel-space 潜在変数は転移を打ち消してしまい、下流の身体的タスクはより多くの映像事前学習から恩恵を受けられません。この知見は、潜在変数のコンパクト性とバックボーン容量がトレードオフの関係にあり、ある閾値以下では上流の映像事前学習が実質的に無駄になるというものです。

  2. 世界とアクションがどのように相互作用するか。 世界とアクションの相乗効果が現れるには、3つの条件が同時に成立する必要があります:専用の action capacity(共有トランクに薄い action head を付けた構造は性能が劣る)、明示的な世界からアクションへの情報フロー(action head は履歴だけでなく現在の世界潜在変数の推定値を条件とする必要がある)、同期同時 denoising(世界とアクションのノイズレベルが同時に進行し、クリーンまたは完全に denoising された世界からアクションを予測しない)。これらのいずれか一つを取り除くと、世界モデリングからの利得がほぼゼロに崩壊します。

  3. 相乗効果のスケーリング。 身体的事前学習は主に分布外汎化を改善し、分布内成功率を向上させるものではありません。分布内タスクでは、追加の身体的データから得られる収益は逓減します。その恩恵は、新規な場面・物体・指示で評価するときに現れます。さらに、世界とアクションの目的を一段階で同時学習することは、段階的パイプライン(世界の事前学習後にアクションの fine-tuning)を上回ります。なぜなら、段階的学習ではアクション適応の際に世界表現が失われるためです。

限界と今後の課題

本研究は意図的に制御された実験設計であり、外部妥当性には限界があります。比較実験ではバックボーン・データ・計算量が揃えられていますが、検討された絶対的スケールはフロンティア映像モデルと比較すると控えめであり、「十分に高い能力」のバックボーンが必要という結論は、フィットした指数を持つスケーリング則ではなく定性的に述べられています。検討されたアクション空間はマニピュレーションベンチマークで典型的なものであり、同期同時 denoising が高頻度連続制御(例えば100Hz以上のロコモーション)においても必要かどうかは確立されていません。汎化の主張は選択された特定のOODスプリットと使用された映像事前学習コーパスに依存しており、映像事前学習のどの特性(動きの多様性・場面の多様性・物理的妥当性)がOOD性能向上を引き起こすかは切り分けられていません。最後に、アブストラクトテキストは途中で切れており、アブレーション各セルにわたる具体的な成功率の差分については、論文本体から直接読み取る必要があります。

なぜ重要か

WAM研究は設計選択の絡み合いによりボトルネックが生じていましたが、OpenWAMはそれをモジュラーな基盤に変換し、個々の要素を入れ替えて測定できるようにするとともに、将来のシステムが採用または反証できる3つの具体的な設計原則(コンパクト潜在変数 + 高能力バックボーン、明示的な世界からアクションへのフローと同時 denoising を備えた専用 action head、OOD性能のための一段階同時学習)を提示しています。

Source: https://arxiv.org/abs/2609.07398

Hacker News Signals

AlphaGenome Atlas: ヒトDNAの高解像度マップ

DeepMindのAlphaGenome Atlasは、ゲノムスケールの予測モデルであり、一塩基分解能でヒトゲノム全体にわたる調節エレメントをマッピングします。主要な技術的貢献は、数百ものゲノムアッセイ(ATAC-seq、ChIP-seq、RNA-seq、Hi-Cなど)を同時に学習したsequence-to-activityモデルであり、128 bpのビンを全ゲノムにわたってタイリングすることで、生のDNA配列からクロマチンアクセシビリティ、転写因子結合、ヒストン修飾、遺伝子発現、および三次元コンタクトマップを予測します。

アーキテクチャはEnformerの系譜を踏まえつつも、コンテキストウィンドウを大幅に拡張し——最大1 Mbの配列を扱えます——クロスアッセイおよびクロス細胞型コンディショニングを組み込んでいます。数千の実験トラックにわたるマルチタスク学習により、各アッセイを独立してフィッティングするのではなく、共通の調節文法を学習することが促されます。出力は密なアノテーションであり、任意のゲノム区間に対して、数十の細胞型にわたる予測された調節状態が得られます。

実用的な価値は変異効果予測にあります。SNPやインデルが与えられると、リファレンスアレルと代替アレルに対するモデルの出力の差分をとることで、アッセイごと・細胞型ごとの影響スコアが得られます。マルチトラック出力により、例えばある変異が肝臓特異的にH3K27acを破壊するのか、それとも広範に影響するのかを局所化できるため、これはDeepSEAやBasenji などの既存ツールよりも情報量が豊富です。Atlas releaseは、既知のヒト変異にわたってこれらの予測を事前計算したものであり、トラックハブとして閲覧可能です。

限界として、モデルは依然としてバルクアッセイで学習されているため、細胞型分解能は学習データの多様性によって制限されます。大規模な構造変異や複雑なハプロタイプの効果予測は現時点では対象外です。変異効果の因果解釈には依然として実験的な追試が必要であり、モデルが与えるのは相関的な調節予測であって、メカニズム的なものではありません。

Source: https://blog.google/innovation-and-ai/models-and-research/google-deepmind/alphagenome-atlas/


C*: Cにおけるプログラミングと検証の統合(2025年)

本論文はCを提案します。CはCの保守的な拡張であり、分離論理に基づく仕様言語をソースの構文に直接埋め込むことで、CのツールチェーンやProof Assistantの別フロントエンドを離れることなく演繹的検証を可能にします。

重要な設計方針は、Cのアノテーションを第一級の構文要素として扱うことです。具体的には、関数の事前・事後条件、ループ不変条件、ゴースト変数などを(単なるコメントではなく)構文的に統合し、拡張されたコンパイラで解析します。検証条件生成器はHoare論理・分離論理のスタイルで証明義務を抽出し、SMTバックエンド(現在はZ3)によって自動的に放電します。特筆すべきは、Cが安全な抽象モデルを押しつけるのではなく、標準のCメモリモデルをそのまま保持している点であり、これにより検証対象がハードウェアで実際に実行されるコードと一致します。

使用される分離論理のフラグメントには、エイリアシングと所有権の推論のための標準的なpoints-to述語および分数パーミッションが含まれます。空間論理積 P * Q は第一級の構文要素であるため、ヒープ操作コードに対してフレーム条件を尊重した仕様を記述できます。ゴースト状態はコンパイル時に消去されるため、実行時オーバーヘッドはゼロです。

本論文では複数のデータ構造(連結リスト、木構造、メモリアロケータ)の検証を実演し、Frama-C/WPおよびVeriFastとのアノテーション量を比較しています。C*は、CのイディオムとVC生成器の自動化との緊密な統合により、等価な証明に対してより少ないアノテーション行数で済むと報告されています。

未解決の問題としては以下が挙げられます。分離論理のSMTエンコーディングは完全ではないことが知られており、複雑なヒープ形状ではタイムアウトが発生したり手動での補題追加が必要になることがあります。並行処理は扱われておらず、所有権モデルは逐次的なものに限られます。仕様を段階的に記述しなければならない大規模コードベースへのスケーリングについても未対応です。

Source: https://arxiv.org/abs/2504.02246


Show HN: LLM Attention Visualization

このツールは、transformer言語モデルのattention重み行列をブラウザ上でインタラクティブに描画します。実装では、モデル(現在はローカルまたはAPIバックエンドの推論エンドポイント経由)にクエリを送り、[L, H, T, T](レイヤー \times head \times シーケンス \times シーケンス)の形状を持つ完全なattentionテンソルを抽出し、レイヤーとheadの組み合わせをナビゲートしながらトークンごとのattention分布をハイライト表示できます。

技術的に興味深い点は、このツールがinduction headや位置的なattentionパターンについて明らかにすることです。Induction head――mechanistic interpretabilityの文献において特定された、in-contextコピーを担うメカニズム――は、attention行列においてリピート距離分だけオフセットされた特徴的な対角ストライプとして現れます。このツールは、特別な計装を必要とせずにこれを可視化します。繰り返しのトークン列に対するattentionを見るだけで確認できます。

実装では、attentionの抽出をクライアントサイドで実行可能な場合(小規模モデルにはWebAssemblyランタイム経由)に行い、APIバックエンドのモデルについては薄いサーバープロキシを通してパイプ処理します。可視化には、128×128以上のattention行列でもパフォーマンスを維持するため、SVGではなくcanvasベースのヒートマップレンダラーを使用しています。カラーマッピングはhead単位で正規化されており、特定のheadが他を圧倒して見えなくなることを防いでいます。

著者が認識している既知の制限として、生のattention重みは情報フローの代理指標として不十分であるという点があります。Attention \times valueノルム(「attention rollout」またはgradient重み付きattentionアプローチ)の方がより忠実ですが、まだ実装されていません。このツールは、定性的なパターン発見――位置バイアスの検出、どのheadが構文的な関係と意味的な関係のどちらに特化しているかの識別――には最も有用ですが、厳密な回路レベルの分析には適していません。

教育や初期探索には有用ですが、本格的なinterpretability研究におけるactivation patchingやlogit attributionの代替にはなりません。

Source: https://ishamf.dev/p/llm-attention-visualizer/


AIによる数学のブレークスルーが論争に火をつけた経緯

このScience誌の記事は、FrontierMathベンチマークおよびAlphaProof/AlphaGeometryのIMOパフォーマンスに関する主張から生じた波紋を取り上げており、具体的な論争の焦点は次の点にあります。評価セットに問題が使用された数名の数学者が、インフォームドコンセントなしに問題が利用されたこと、またベンチマークの構築プロセスがモデル開発者から十分に遮蔽されていなかったことを主張しています。

この論争の背後にある技術的な実質は本物であり、社会的側面とは切り離して考える価値があります。FrontierMathは、数論・代数幾何・組合せ論にわたる専門家レベルの問題集であり、新規の計算や証明構築を要求することで暗記に対する耐性を持つよう設計されています。あるシステムがこれらの問題の無視できない割合を解いたという主張(正確な数字は争われています)は、大きな進歩の指標として扱われました。

方法論上の問題は評価汚染(evaluation contamination)です。モデルの学習コーパスに、問題の出典または翻案元となる数学的文献が含まれている場合、正解率は汎化能力と記憶の検索を混同したものになります。これはNLPベンチマークにおけるデータ汚染問題と構造的に類似していますが、数学的問題の類似性は字義的なものではないため、監査がより困難です――言い換えても難易度は変わりません。

二次的な論争は「解いた」という意味に関わります。自動定理証明器は形式的証明を検証できますが、FrontierMathの問題には数値的な答えで十分な計算タスクも含まれています。一般化不可能なchain-of-thoughtを通じて正しい整数を出力するシステムは、検証可能な証明オブジェクトを構築するシステムとは同一ではありません。答えが正しければ証明がなくても数学的能力のシグナルとみなすべきかどうかについて、コミュニティは意見が分かれています。

これが浮き彫りにするオープンクエスチョンは、数学ベンチマークにもMLにおけるheld-outテストセットに類似した再現可能かつ監査可能な構築プロトコルが必要であり、明確なプロベナンスと敵対的な問題多様性の保証が求められるという点です。

Source: https://www.science.org/content/article/how-ai-math-breakthrough-ignited-controversy


GPT-o3(GPT-5.6 Sol と呼称)が量子コンピューティング実験の運用を支援する方法

OpenAIの投稿では、パートナー機関における量子コンピューティング実験ワークフローにおいて、自社のフロンティア推論モデルをラボアシスタントとして活用している事例が紹介されています。技術的な内容は見出しが示唆するよりも限定的であり、このモデルは量子アルゴリズムの設計や回路シミュレーションを行っているわけではありません。その代わりに、三つの具体的なタスクに使用されています。すなわち、パルスレベル制御コード(Python製、Qiskitまたはそれぞれの類似フレームワークを対象)の記述とデバッグ、ノイズを含む実験出力ログの解析と要約、そしてキャリブレーション実験のためのパラメータスイープ設定の草案作成です。

パルスレベルのコード生成のユースケースは、技術的に最も興味深いものです。超伝導量子ビット実験では、マイクロ波パルスエンベロープ(Gaussian、DRAG補正済み、flat-top)を精密なタイミングおよび周波数パラメータとともに指定する必要があります。これは単調で誤りが生じやすいボイラープレートです。このモデルは、実装するゲートを自然言語で記述するだけで、構文的に正しいQiskit Pulseスケジュールを生成し、実験のイテレーションにかかるターンアラウンドタイムを短縮します。

ログ解析のユースケースは単純明快です。T1/T2測定の出力、読み出し忠実度行列、ゲートエラーバジェットが抽出・要約されます。これは本質的に、半構造化テキストからの構造化情報抽出であり、現在のモデルの能力の範囲内に十分収まります。

投稿が省略している限界点として、モデルはループ内に物理シミュレータを持たないため、生成されたパルススケジュールが意図したユニタリを実際に実装するかどうかを検証できません。物理的に意味のある検証はすべて、ハードウェア上または別途用意されたシミュレーションによって依然として行われます。高速化の主張は妥当性があるものの、定量化されておらず、モデルを使用した場合と使用しない場合の実験サイクル時間を計測した対照実験は提示されていません。

Source: https://openai.com/index/codex-quantum-computing-experiments/


モバイルエージェントを動かすVM(Instinct、Claude Code)

この記事は、AIコーディングエージェントが自律的に動作する際——シェルコマンドの実行、ファイルの編集、テストの実行、Webブラウジングなど——に使用されるサンドボックス実行環境についての技術的なサーベイです。著者はVMまたはコンテナのプリミティブ、スナップショット/リストアの仕組み、ネットワーク分離ポリシーという3つの層について解説しています。

コアとなるシステム上の問題は、エージェントループが任意の状態からフォークできる、高速でクリーンな環境を必要とするという点です。素朴なアプローチ(タスクごとに新しいDockerコンテナを起動する)では5〜30秒の起動レイテンシが発生し、タスクの途中でチェックポイントを作成して再開することも不可能です。本番環境での解決策としては、VMスナップショット機能——複数のプロバイダが採用しているFirecracker microVM、またはメモリスナップショットをサポートするQEMU——を使用することで、ウォームベースイメージ上でサブ秒のフォーク時間を実現しています。これはFly.ioの「machines」プロダクトやLambdaのコールドスタート最適化の基盤となっているのと同じプリミティブです。

コーディングエージェントに特化して求められる特性は以下の通りです:(1)再現可能なファイルシステム状態——エージェントが最初からではなくチェックポイントからリトライできるようにするため;(2)ネットワーク外部通信の制御——エージェントがデータを外部に送出したり任意の外部呼び出しを行うことを防ぐため;(3)リソースのアカウンティング——エージェントが誤ってfork bombを引き起こしたり無制限のディスクを消費する可能性があるため。この記事では、Claude Codeのローカル実行モードはこのいずれも実施していないと指摘しています——ユーザーのマシン上で直接動作し、OSレベルの分離ではなくモデルのコンプライアンスに依存しています。

Firecracker を使用するInstinctのような完全にサンドボックス化されたデプロイメントとの対比によって、実際のセキュリティ上の問題が浮かび上がります:ファイルシステムアクセスとシェル実行を持つローカル実行のコーディングエージェントに対する脅威モデルは、クラウドでサンドボックス化されたものとは実質的に異なります。

Source: https://rohanadwankar.github.io/posts/platforms.html


Coop: Claude CodeおよびCodexを実行するための隔離されたVM環境

Coopは、Trail of Bitsによるオープンソースツールであり、AIコーディングエージェント(Claude Code、OpenAI Codex CLI)をホストのファイルシステムやネットワークへの直接アクセスを与えることなく実行するための、隔離されたFirecracker microVM環境をプロビジョニングします。セキュリティ上の動機は明確です。これらのエージェントは任意のシェルコマンドを実行するため、ホストの全権限で動作させることは、認証情報や機密リポジトリを含む開発者マシン上では許容できない攻撃対象領域となります。

実装はFirecrackerのAPIをラップしてVMのライフサイクル(作成、スナップショット、リストア、破棄)を管理し、最小限のLinux rootfsをマウントし、明示的に指定されたプロジェクトディレクトリのみをゲストにbind-mountします。ネットワークは完全に無効化されるか、特定のアウトバウンドホスト(パッケージレジストリなど)のみを許可する制限付きプロキシ経由でルーティングされます。エージェントプロセスはVM内で非特権ユーザとして動作します。

重要なユーザビリティ機能は透過的なワークスペースミラーリングです。ホスト側のプロジェクトディレクトリがVM内に同期されるため、エージェントはローカルで実行されているかのようにファイルを参照・変更できますが、すべての実行は隔離されています。タスクの完了または失敗時には、潜在的に破損したワーキングツリーではなく、変更内容のクリーンな差分が得られます。

Firecrackerの採用は適切です。ハードウェア仮想化レベルの隔離を提供しつつ、起動時間は約125ms、VM当たりのメモリオーバーヘッドは約5MBであり、インタラクティブなエージェントセッションとして実用的です。代替手段(gVisorやbubblewrapによるルートレスコンテナ)は、カーネルエクスプロイトに対して隔離保証が弱くなります。

現在の制限事項:Linuxのみ対応(Firecrackerの要件)、KVMサポートが必要(パススルーなしではほとんどのクラウドVMでネステッド仮想化は不可)、GPU workloadには未対応。セッション途中のチェックポイントのためのスナップショット・リストア機能は計画中として挙げられています。

Source: https://github.com/trailofbits/coop


Tao: AIによって非再生可能な形で消費されつつある未解決数学問題

Terence TaoのMastodonへの投稿は、未解決数学問題に対するAI評価についての鋭い観察を述べています。彼の主張は、特定の未解決問題がAIシステムの数学的能力のベンチマークとして使用された場合、その結果を公表する行為自体がその問題をベンチマークとして事実上退役させてしまうというものです——理由としては、その解法が将来のモデルの学習データになるか、あるいはその問題が自動化された手法によって解けることがコミュニティに知れ渡り、問題の難易度の認識と研究上の価値が変化してしまうからです。

「非再生可能な資源」という捉え方は正確です。数学の未解決問題がベンチマークとしての価値を持つのは、まさにその解が未知であり、難易度が人間の専門家の判断によって較正されているからです。いったん(AIによるものであれそうでないものであれ)解かれて公表されると、その較正シグナルは消費されてしまいます。ML における held-out テストセット(新しいデータを生成することで置き換え可能)とは異なり、深い未解決問題は同等の難易度のものを需要に応じて製造することができません。

これはAIの数学評価に対して具体的な方法論的含意をもたらします:著名な未解決問題をワンショットの能力実証として使用することは、見かけほど科学的に強固ではありません。よく知られた問題における単一の成功は、能力の分布を確立するものではありません。難易度や分野にまたがる大量の問題サンプルを用いて、盲検で評価し、結果を統計的に集計することが求められます——これはまさにFrontierMathが試みていた設計であり、かつその整合性が問われている設計でもあります(上記のScience誌の記事を参照)。

Taoの第二の指摘は研究文化についてです:数学者たちは共同研究の規範として予想や部分的な結果を公開しており、その開放性が現在、非対称的にAIラボによるプライベートな評価に利用されているというのです。これは開かれた数学文化とAI能力研究のインセンティブ構造との間の、真に存在する緊張関係です。

Source: https://mathstodon.xyz/@tao/117237320796901560

注目すべき新リポジトリ

tigerless-labs/agent-memory

AIエージェント向けの長期記憶ランタイムで、プレーンなMarkdownファイルを正規のストアとして扱います。すべてをAPI経由のベクターデータベースにembeddingするのではなく、agent-memoryは記憶を人間が読める.mdファイルとして保持し、外部APIキー不要の軽量なスコアリング手法によるローカルでのランク付き検索を実行します。注目すべき設計上の決断は「sleep-time Manage layer」です。これはホットパスの外側で動作する独立したプロセスであり、記憶エントリの統合・重複排除・優先度再設定を行います。インラインのwrite-throughキャッシングではなく、オフラインでの記憶統合に類似した仕組みです。Claude CodeとCodexの両方が単一のストアを共有できるため、エージェントがタスクを引き継いだり、セッション間で一貫したコンテキストを必要とする場合に有効です。プレーンMarkdownの設計により、標準的なツールで直接、記憶の検査・編集・バージョン管理が可能となり、不透明なembeddingストアに対して運用上の大きな利点があります。検索はローカルでキーワード/セマンティックランキングを使用しているようで、レイテンシを低く抑えつつベンダーロックインを回避しています。マルチセッションエージェントを構築しており、生の検索性能よりも監査可能性とポータビリティを重視するすべての人に有用です。

Source: https://github.com/tigerless-labs/agent-memory


wanshuiyin/HERO-Anti-OverDefense

HEROは、コーディングエージェントが過剰な防御的コーディングによってより劣った出力を生成する4つの系統的な失敗モードを特定しています:Hashing(不要なチェックサムや検証レイヤーの追加)、Edge cases(可読性を犠牲にして起こりにくい分岐を処理すること)、Rubrics(意図を見失った明示的な基準への過度な文字通りの遵守)、Overbuild(指定されたスコープを超えた足場構築)です。このリポジトリは、エージェントの動作をこれら4つの軸に沿って制約する、貼り付け可能なコントラクト——構造化されたprompt/システム命令ブロック——を提供しています。これは後処理フィルターではなく動作仕様として位置づけられており、すなわち生成時に機能します。このアプローチはモデル非依存であり、Claude Code、Codex、Cursor、Copilot、Windsurf、Gemini CLIに対してテストされています。技術的な内容は軽量(主としてprompt engineeringの成果物)ですが、このタクソノミーは、命令追従モデルが最小十分解から系統的に乖離する箇所を実証的に特徴付けようとする人にとって有用です。コード生成におけるspecification gamingおよびreward hackingに関する研究と並行して検討する価値があります。

Source: https://github.com/wanshuiyin/HERO-Anti-OverDefense


useagenthq/useagent

AIエージェントに対して隔離されたクラウドコンピューティング環境をプロビジョニングし、チーム共有のツールやコンテキストを通じてルーティングするオープンソースのオーケストレーション層です。各エージェントは専用のサンドボックス化された「クラウドコンピュータ」を持ち、依存関係のインストール、ブラウザの実行、ファイルの書き込みが可能な程度の永続性を備え、中間ステップではなく完成した成果物(PR、レポート、スプレッドシート、スライドデッキ)を返します。このアーキテクチャはモデルプロバイダーの上位に位置しており、独自の推論経由でプロキシするのではなく、チームが既存のサブスクリプションを利用してClaude Code、Codex、またはOpenCodeを駆動できます。これはE2BやModal上で動作するエージェントランナーとアーキテクチャ的に類似していますが、開発者向けAPIではなく、協調的なチームワークフローを対象としている点が異なります。サンドボックスのライフサイクル管理方法、タスクをまたいで状態が永続するかどうか、エージェントごとのツールアクセス制御の方式など、重要な技術的事項はソースコードを直接確認する価値があります。オープンソースとして公開されていることは、DevinやFactoryといった商用代替品との差別化要因であり、エージェントが実際に何を実行するかについてチームが監査可能な透明性を持てます。

Source: https://github.com/useagenthq/useagent


Vistyy/nopus

コーディングエージェントの応答を対象とした、決定論的な文章チェックライブラリです。LanguageToolやValeのようなツールが人間の文章を対象とするのに対し、nopusはLLM出力の自然言語部分——説明文、docstring、コミットメッセージ、インラインコメント——に焦点を当て、情報密度を低下させる冗長表現、曖昧化フレーズ(hedge phrases)、受動態構文、フィラー表現を検出するためのルールベースチェックを適用します。ここでの「決定論的」とは、モデルベースではなくルールベースであることを意味します。チェック結果は再現可能かつ検査可能であり、CIへの統合や自動的なprompt評価パイプラインにおいて重要な性質です。実用上のユースケースは、ループ内に別のモデル呼び出しを追加することなく、エージェント出力の品質を引き締めることにあります。スター数281件でドキュメントが乏しいため、実装の詳細はソースを読む必要がありますが、その設計方針——LLMが生成した文章に対する静的解析——は、コード向けlinterとテキスト向けlinterの間に存在する正当なギャップを埋めるものです。system promptのチューニング時における後処理ステップや回帰テストのベースラインとして活用できます。

Source: https://github.com/Vistyy/nopus


SeanEllyJames/deep-research-skill

情報検索的なサマリーではなく、分析的な研究アウトプットを生成することを目的として設計されたAIエージェント向けのプラグインスキルファイル(構造化プロンプト仕様)です。本スキルが強調する核心的な区別は、ソースを集約することと実際にそれらについて推論することの違いです。このスキルはエージェントに対し、仮説を形成し、ソース間の矛盾を特定し、信頼度レベルを付与し、見つかった事実ではなく未知のものを明示するよう指示します。主に中国語で記述され英語セクションも含むこのスキルは、スキルまたはツールの組み合わせをサポートするエージェントフレームワーク向けのドロップインモジュールとして位置づけられています。技術的な内容はプロンプト構造そのものに集約されており、ソース評価、統合、および不確実性の定量化ステップをどのように順序立てるかに焦点が当てられています。201スターを獲得しており、研究エージェントのprompt engineeringの領域における軽量ながら鋭い貢献といえます。「これが事実です」と「これは根拠ある結論を伴う分析です」を区別する必要のあるエージェントを構築するすべての方に関連します。

Source: https://github.com/SeanEllyJames/deep-research-skill


crmne/fastpotify

RustでネイティブSpotifyクライアントを実装したプロジェクトで、Linux・macOS・Windowsをターゲットとしています。音声のローカルデコードおよびSpotify ConnectプロトコルのサポートにはLibrespotライブラリを使用しており、これによりローカル再生デバイスとしてだけでなく、スマートフォンや他のクライアントからリモート操作するためのConnect対象としても機能します。標準的なSpotify認証情報さえあればプレミアムなWeb APIキーなしにライブラリ全体にアクセス可能です。Rust実装の主な動機は、公式のElectronベースクライアントと比較してリソースオーバーヘッドを低く抑えることにあります。UIはWebレンダラーを介さず、プラットフォームごとにネイティブで構築されています。主要な技術コンポーネントとして、librespotが音声ストリーミングとConnect sinkを担当し、フロントエンド層はライブラリメタデータのためにSpotifyの内部APIと通信します。公式クライアントのメモリ使用量やWaylandサポートに不満を持つLinuxユーザー、またElectron層なしにカスタマイズ可能なSpotifyクライアントを求める方に有用です。

Source: https://github.com/crmne/fastpotify


elie222/rakazo

Grokの会話型ボットインターフェースに対するオープンソースの代替実装です。モデル非依存(model-agnostic)であり、コード実行サンドボックスを内包している点が特徴的です。特定のプロバイダーをハードコードするのではなく、rakzoではオペレーターがバックエンドモデルを設定できる構成になっており、OpenAI互換のエンドポイントであれば何でも利用可能です。サンドボックスコンポーネントにより、エージェントは生成したコードを隔離された環境で実行して結果を返すことができます。これは、会話型コーディングアシスタントを純粋なチャットインターフェースと区別する中核的な機能です。アーキテクチャは、柔軟なモデルルーティング層の上に構築されたNext.jsフロントエンドであり、サンドボックスはおそらくコンテナ化された実行環境で処理されています(詳細はソースコードを参照)。2,168スターを獲得しており、モデルの選択・データルーティング・コストを自社でコントロールしたいチームにとって、セルフホスト可能なGrok Botの代替として支持を集めています。オープンソースという立ち位置が主要な差別化要因であり、オペレーターはどのデータがどこに送られるかを監査し、カスタムツールを追加し、ベンダー固有の機能制限を回避することができます。

Source: https://github.com/elie222/rakazo


Electricitysheep/dsh-handbook

DeepSeek Harness(dsh)のための包括的なバイリンガル(中国語+英語PDF)技術ハンドブックです。インストール、プラグイン開発、パフォーマンスチューニング、ベンチマークケーススタディ、および同一の基盤モデルを用いたマルチエージェント比較評価を網羅しています。マルチエージェントのセクションは特に有用で、同一ベースモデルを使って複数のエージェントインスタンスを同一タスクに対して実行した実証結果を記録しており、制御された環境下での協調オーバーヘッド、prompt感度、および出力分散を明らかにしています。パフォーマンスチューニングの内容はトレーニングではなく推論側の設定を対象としており、セルフホスト型DeepSeekデプロイメントにおけるバッチサイジング、コンテキストウィンドウ管理、および量子化のトレードオフを扱っています。プラグイン開発のドキュメントでは、カスタムツールや検索統合を追加するための拡張ポイントが提供されています。764スターを獲得しているこのハンドブックは、研究成果物というよりも主に実践者向けのリファレンスですが、実証的なベンチマーク手法とマルチエージェント比較データは、エージェンティックなパイプラインにおけるDeepSeekモデルのデプロイメントを評価する際に有用です。

Source: https://github.com/Electricitysheep/dsh-handbook