デイリーAIダイジェスト — 2026-07-28

公開

2026年7月28日

English · 日本語

arXiv ハイライト

マルチターン長期水平計画の物理学:単一・複数教師によるオンポリシー型エージェント蒸留を通じたpre-trainingからpost-trainingへ

問題設定

長期水平マルチターン計画は、基盤モデルエージェントにとって根幹をなす能力ですが、その訓練における起源は不透明です。Webコーパスでは、行動模倣・世界モデル推論・post-trainingによる整形が混在しています。本論文は、完全に制御された合成環境(gym)を構築し、計画能力がどこで獲得(pre-training)・整形(RL/OPD post-training)・統合(多教師蒸留、MOPD)されるかを分離した上で、各軸に沿ったアブレーションを実施します。

3段階研究の概観:pre-training、RL post-training、および多教師統合。

Gym:階層的スキルグラフとAND/ORレシピ

3つの互いに素なドメイン(Fantasy Alchemy、Livestock Farming、Electronic Assembly)が、高さ H、幅 W、各カテゴリにつき N アイテムの木構造としてコンパイルされます。合成ルールは前提条件に対する論理結合として定義され、ターゲットノード v に対して以下のように表されます。

v \iff (u_{1,1}\land\dots\land u_{1,k_1})\lor\dots\lor(u_{m,1}\land\dots\land u_{m,k_m}),

ここで各連言はレシピを表し、外側の選言は選択肢を列挙します。貪欲な最小化によりステップ数の組み合わせ爆発を防ぎ、各ドメインに対して互いに素な抽象グラフ(A、B)が生成されることで、クリーンなクロス環境テストが可能となります。ルールは反事実的であり、pre-trainingの段階で注入されるため、Webの事前知識からの汚染が制御されます。

制御可能な計画gym:3つのドメインにわたる階層的AND/ORスキルグラフ。

Pre-training:データに関する3つの問い

世界モデルは遷移 \mathcal{T}:\mathcal{S}\times\mathcal{A}\to\mathcal{S} として定義されます。本論文では、2つのpre-trainingフォーマットを対比します:(i) 純粋な行動系列模倣、および (ii) 中間推論として s_{t+1}=\mathcal{T}(s_t,a_t) を明示的に出力するCoT軌跡(「世界モデル内在化」)。チェックポイントごとに1,440件の評価インスタンス(3ドメイン \times 3難易度レベル \times 160インスタンス、T=0.4 で8サンプル、20ステップバジェット)を用いた評価の結果、CoT状態遷移モデリングは長期水平汎化において大幅に優れた性能を示し、そのギャップは難易度が高いほど拡大します。

世界モデリングあり・なしの場合の3難易度レベルにわたる成功率;ギャップは水平長とともに拡大する。

データ分布と品質に関するさらなる2つの知見:

  • アトミックスキルは合成されない。 短いアトミック遷移のみで訓練しても、組み合わせ的な長期水平タスクへの汎化は失敗します。長期水平軌跡をわずかな割合で加えるだけで、そのギャップの大部分が埋まります。組み合わせ的汎化は、原始操作の集合から自動的には得られません。
  • 長期水平においては準最適な軌跡が有害である。 冗長または誤りのあるデモンストレーションは、ステップごとの誤差が乗算的に蓄積されることでチェーン全体に増幅し、単一ターン設定と比べて最終タスクの成功率をはるかに大きく低下させます。

Post-training:相互情報量によるパターンと知識の分離

本論文は、エージェントの出力を一般的な計画パターン P(反省、バックトラッキング、サブゴール分解)とタスク固有の計画知識 K(どのレシピか、どのアイテムか)に分解し、以下を計測します。

I(T;P)=H(P)-H(P\mid T),\qquad I(T;K)=H(K)-H(K\mid T).

P はタスク間で再利用可能である一方、K は現在の状態に強く依存するため、I(T;P)<I(T;K) となります。この分解により、post-trainingの効果をパターンに関する3つの領域に分類します:不要(ベースモデルにすでに存在する)、有効(RL/OPDが確実に注入できる)、サポート不能(より豊かなpre-training基盤なしにはパターンを引き出せない)。これにより、GRPOとオンポリシー蒸留(OPD)が成功または失敗する理由が、目標能力がどの領域に位置するかに基づいて説明されます。

多教師OPD:カスケード蒸留とその失敗モード

混合MOPD(mixture MOPD)は教師の同時運用が必要なため、分析はカスケード型に焦点を当てます。教師 m\in\{1,\dots,M\} に対するオンポリシー目的関数は、学生自身のロールアウト \tau\sim\pi_\theta 下のトークンレベルKLです。

\mathcal{L}^{(m)}_{\text{Agent-OPD}}(\theta)=\mathbb{E}_{\tau\sim\pi_\theta}\!\left[\sum_{k=1}^{K}\sum_{t=1}^{T_k}D_{\text{KL}}\!\left(p_{k,t}\,\|\,q_{k,t}^{(m)}\right)\right],

ここで q_{k,t}^{(m)}=\pi^{(m)}_{\text{teacher}}(\cdot\mid H_k,\hat{Y}_{k,<t}) であり、訓練は m=1,\dots,M の順で反復されます。3つのレジームが同定されます。

  • Q1 汎化モード: 教師が環境をまたいで互換性のある計画パターンを共有する場合、MOPDはクロス環境転移を実現します。
  • Q2 継続学習モード: パターンが非共有であるが非競合の場合、逐次的蒸留により壊滅的な喪失なしにスキルを蓄積できます。
  • Q3 競合モード: 教師が矛盾したパターンをエンコードしている場合(例:グラフAとグラフBで異なるバックトラッキング事前分布)、カスケードMOPDはクロス環境性能を失い、後の教師が前の教師による能力を上書きします。

これは実際の基盤モデルのレシピ(MiMo-V2-Flash、GLM-5、Nemotron-Cascade 2、DeepSeek-V4)に直接対応しており、本論文ではこれらをクロスドメイン能力統合クロスステージ能力保持という2つのパラダイムに位置付けます。

限界とオープンクエスチョン

Gymは反事実的合成ルールと抽象アイテムを使用しており、Webのpre-trainingから強い事前意味論をトークンが持つ場合にも同じ段階的構造(世界モデル優位性、アトミック合成ギャップ、準最適軌跡の毒性、MOPD競合レジーム)が成立するかは確立されていません。水平長は20ステップに制限されており、評価はチェックポイントごとに1,440インスタンスと、本番環境と比較して小規模です。TP/K の間の相互情報量は定性的に議論されるにとどまり、直接推定はなされていません。また、パターン/知識の分割は抽出可能な表現として実装されていません。最後に、カスケードMOPDの分析は混合形式のMOPDを除外しており、その干渉ダイナミクスはおそらく異なります。

なぜこれが重要か

本論文は「長期水平計画がなぜ難しいか」という問いを制御可能かつ分解可能な問題へと変換し、具体的な設計指針を導出しています:状態遷移CoTをpre-trainingに組み込む、アトミックスキルのみでなく一部の長期軌跡を含める、準最適なデモンストレーションを積極的にフィルタリングする、そして教師の計画パターンが競合するかどうかに基づいてMOPDの順序を決定する。これらは、エージェント型post-trainingパイプラインを構築する誰にとっても直接的に実行可能な指針です。

Source: https://arxiv.org/abs/2607.24720

dRAE: Representation Autoencoder with Hyper-Spherical Codes

問題設定

高容量な視覚エンコーダ(CLIP、SigLIP、DINOv2)上に構築された離散視覚トークナイザは、視覚と自己回帰型/masked LMを統合する上でのボトルネックとなっています。このようなエンコーダに対して標準的なVQ-VAEスタイルの量子化を適用すると破綻します。コードブックサイズ K を増やすにつれて利用率が低下し、下流タスクの品質が頭打ちになります。著者らはこの失敗の原因を最適化上のトリックの問題ではなく、メトリクスのミスマッチにあると主張しています。視覚エンコーダの特徴量は薄い球面シェル上に存在します(高次元におけるガウス的な集中現象と、方向的一様性に向けたコントラスト学習/自己蒸留の訓練圧力の結果として)。しかし \ell_2 最近傍割り当ては角度方向とノルムを混同します。ノルムが大きいコードは意味的な方向に関わらず割り当てを支配し、ノルム分散が大きく角度分布が偏ったコードブックを生成します。

二つの診断実験がこの分離を動機づけています(Tab. 1)。LLaVAスタイルのMLLMに生の特徴量 Z または \ell_2 正規化された Z' = Z/\|Z\|_2 を入力した場合、性能低下は約1%にとどまります(MMBench 82.2 → 81.1、TextVQA 61.3 → 60.7、POPE 85.2 → 84.3):すなわち意味情報は本質的に方向的です。一方、Z' からピクセルを再構築するViTデコーダは破綻します(PSNR 22.5 → 20.6、SSIM 0.62 → 0.51、rFID 4.62 → 9.57):ピクセルレベルの忠実度に必要な構造的な信号はノルムに含まれています。したがって量子化器は両方を保持しつつ、角度によってコードを割り当てる必要があります。

手法:Hyper-Spherical Quantization

HSQはルーティングをノルムから切り離します。潜在変数 z \in \mathbb{R}^d とコードブック \{c_k\}_{k=1}^{K} が与えられたとき、割り当てはコサイン類似度を用います:

k^\ast = \arg\max_k \frac{\langle z, c_k \rangle}{\|z\|\,\|c_k\|}.

コードブックloss \mathcal{L}_{\text{codebook}} はコサイン空間で定義され(選択されたコードの方向を z の方向に引き寄せる)、commitment loss \mathcal{L}_{\text{commit}}\ell_2 のまま保持されるため、エンコーダ出力は依然としてコードのノルムに一致します:

\mathcal{L}_{\text{codebook}} = 1 - \cos(\text{sg}(z), c_{k^\ast}), \qquad \mathcal{L}_{\text{commit}} = \|z - \text{sg}(c_{k^\ast})\|_2^2.

VQとHSQのコード空間および学習済みコードブック分布の比較図。

Figure 1(c)はこの重要性を示しています:VQコードのPCA射影は角度的多様性が低い塊として集中し、重い裾を持つノルム分布を示す一方、HSQコードはシェル上に一様に分布します。完全コサイン変形(両方のlossにコサインを使用)では再構築が破綻し(Tab. 7:rFID 3.02 → 12.7、SSIM 0.65 → 0.33)、\ell_2 commitment termがエンコーダのノルム分布をデコーダにとって情報量のある状態に保つ役割を担っていることが確認されます。

トークナイザはRAEのレシピに従います:事前学習済みSigLIP2 ViT-So400Mエンコーダ、対称的なViTデコーダ、凍結されたteacherへの蒸留loss、1ステージのend-to-end学習です。コードブックの初期化トリック、EMAリセット、dead-codeの復活、カリキュラムはいずれも使用していません。

結果

再構築のアブレーション(Tab. 7)はメトリクスの寄与を分離します:割り当てのみをコサインに切り替えるとrFIDが 3.59 → 3.31 に低下し、コサイン \mathcal{L}_{\text{codebook}} を加えるとSSIM 0.65 で 3.02 に達します。

ImageNet上でのC2I(Tab. 5)、サンプラーチューニングなしの離散diffusion headを使用:K=32{,}768 において、HSQはgFID 4.83 / IS 268.4 に対してVQは 5.37 / 251.3;K=65{,}536 では、HSQは 4.45 / 287.3 に改善される一方、VQは 5.51 / 264.3 に劣化します。VQはコードブックを大きくしても恩恵を受けられず、HSQは単調にスケールします。iREPAアライメントを適用した場合(Tab. 6)、HSQはgFID 6.11 に対してVQは 7.16 に達します。

理解タスク(Tab. 8、Qwen2.5-7BによるLLaVA-1.5レシピ):HSQはコードブックサイズとともに改善します(GQA 34.3 → 35.8、MMB 44.1 → 45.6、K=16K から 65K へ)が、VQは退化します(GQA 34.1 → 33.8、MMB 43.8 → 42.0)。著者らはVQが訓練後半に再構築lossが振動し、蒸留lossが単調増加することも報告していますが、HSQではそのような現象は見られません。

特徴量再構築の代理実験(Tab. 9)、エンコーダを凍結して z を直接量子化:HSQはPSNR 8.24 / コサイン 0.92 に対してVQは 4.91 / 0.81 に達します。

K=131{,}072 での画像・意味論的な統合学習、量子化器を凍結エンコーダとQwen-3.5の間に挿入し、並列なピクセルViTデコーダとエントロピー正則化 \tau=0.01 を使用:

統合画像・意味論的最適化における量子化手法の比較。

HSQはコードブック利用率100%を達成し、再構築lossとLM lossの両方において最も速い収束を示し、確率的(Gumbelスタイル)サンプリングを使用しないにもかかわらずIBQおよび \ell_2 正規化IBQを上回ります;VQは両軸で最も悪い結果となっています。

限界と未解決の問題

  • 特徴量再構築品質(PSNR 8.24)は絶対値として依然として低いです;著者らはこれをエンコーダ特徴量の固有ノイズと知覚的な教師信号の欠如に起因するとしていますが、この点がHSQをピクセル代理なしで直接の意味トークナイザとして使用することを制限します。
  • 本設計は特徴量が実際にシェル上に集中するエンコーダ(CLIP/SigLIP/DINOファミリー)に依存しています。このような幾何学的性質を持たないエンコーダ(例:生のVAE潜在変数)では、角度ルーティングの仮定が成立しない可能性があります。
  • コサイン/\ell_2 の混合レシピは経験的なものであり、アブレーション以上に \ell_2 commitment termが有用なノルム構造を保持する理由についての原理的な説明はありません。
  • 生成結果は強力ですが離散diffusionを使用しており、これらの非常に大きな(K=131K)語彙を用いた自己回帰的な次トークン生成への影響は完全には明らかになっていません。

重要な意義

本論文はコードブック崩壊問題を最適化の病理としてではなく幾何学の問題として再定式化し、角度的割り当てとコサインコードブックloss(\ell_2 commitmentを保持したまま)という2行の変更によって、現在のトークナイザが依存する安定化のための工夫(EMA、dead-codeリセット、確率的ルーティング)を一切用いずに K=131{,}072 において利用率100%を達成することを示しています。これが一般化するならば、視覚語彙をLMサイズの予算にスケールする上での実質的な障壁を取り除くことになります。

Source: https://arxiv.org/abs/2607.22148

Kimi K3: Open Frontier Intelligence

Kimi K3は、2.8Tパラメータの Mixture-of-Experts モデルであり、104Bの活性化パラメータ、ネイティブビジョン、および1Mトークンのコンテキストを備えています。本レポートは、純粋なスケールアップではなく、K2に対するアーキテクチャおよびインフラストラクチャの更新として位置付けられています。固定された計算量において、著者らはK2に対して約2.5\timesのスケーリング効率を報告しており、これはKimi Delta Attention(KDA)、Attention Residuals、Stable LatentMoEという3つの名前付きコンポーネント、および調整可能な推論努力を伴うマルチドメインRLを中心としたpost-trainingの仕組みによって実現されています。

アーキテクチャ

attention スタックは、ほとんどの層において標準的なsoftmax attentionをKimi Delta Attention(DeltaNetファミリーに属するlinear-attentionの変種)に置き換えています。この再帰は状態行列 S_t \in \mathbb{R}^{d_k \times d_v} を以下のように更新します。

S_t = S_{t-1}(I - \beta_t k_t k_t^\top) + \beta_t v_t k_t^\top,

したがって各トークンは、加算的な書き込みではなく、連想メモリへのランク1の修正を行います。これにより、linear attentionの O(N) 時間および O(1) のトークンごとメモリを保持しつつ、モデルに明示的な消去・書き込みチャネルが与えられます。データ依存のゲート \beta_t と組み合わせることで、KDAは素朴なlinear attentionよりも制御可能な状態空間モデルに近い挙動を示します。本論文はこれをAttention Residualsと組み合わせており、これはattention前の残差を深さ方向にルーティングすることで、後の層が再計算することなく以前のattention状態を再利用できるようにし、深さ方向の情報フローを改善します。一部の層では完全なsoftmax attentionを保持することで正確な長距離検索を維持しており、linear attentionコンポーネントとしてKDAを用いたJamba/RecurrentGemmaと精神的に類似したハイブリッドスタックを実現しています。

MoEブロックについては、Stable LatentMoEがトークンごとに896個のルーティングされたエキスパートのうち16個を活性化します。「latent」という修飾語は、高いエキスパート数のもとでルーターを安定させるために、ルーティングが低ランク射影空間で行われることを指します。この活性化率({\sim}1.8\%)での896エキスパートは、K2やDeepSeek-V3と比較して積極的であり、安定性の主張はその射影とロードバランシングの補助lossに依拠しています。2.8T総計に対して104Bが活性化されることで、スパース比は{\sim}27\timesとなります。

トレーニングインフラストラクチャ

KDAを用いた2.8T MoEのトレーニングは容易ではありません。なぜなら、linear-attentionカーネルはエキスパート並列処理や、attentionが (Q,K,V) の純粋な関数であると仮定するパイプラインステージとうまく組み合わさらないからです。本論文では、KDAに対するアルゴリズムとシステムの協調設計(シーケンス並列処理と互換性のあるfused再帰カーネル)、16/896の活性化パターンに合わせてメモリ管理を調整した「完全にバランスの取れた」エキスパート並列トレーニング、そしてpost-trainingについては、永続的なロールアウトとサンドボックス状態を持つミリオントークンのエージェンティックRLセットアップを説明しています。この永続性は重要です。1Mコンテキストにおけるエージェンティックな軌跡は環境I/Oによって支配されるため、ポリシー更新をまたいでサンドボックス(シェル、ブラウザ、コードエグゼキュータ)をウォーム状態に保つことで、各ロールアウト時の状態の再マテリアライズを回避できます。これは、素朴なRLHFパイプラインが長いホライズンで崩壊する原因となる部分です。

Post-training

Post-trainingはRLを重視しており、一般的なチャット、エージェンティックなツール利用、コーディングにわたって行われ、複数の推論努力レベルが共同でトレーニングされます。具体的には、モデルは努力トークンに条件付けられており、単一チェックポイントが低レイテンシの直接回答と高努力の chain-of-thought / ツール利用軌跡の両方をサポートします。著者らは、これが合成的汎化をもたらすと主張しています。すなわち、あるドメインで学習されたスキル(例えばコーディングRLにおけるデバッグ)が別のドメイン(エージェンティックなウェブタスク)に転移するのは、努力条件付きポリシーがドメイン知識から推論戦略を因数分解するためです。長いホライズンの実行は、instruction tuningの副産物としてではなく、第一級の目標として重視されています。

結果

abstractは、長いホライズンのコーディング、エージェンティック、知識、推論、およびビジョンベンチマークにおいてフロンティアレベルの性能を主張しており、見出し数値はK2に対する{\sim}2.5\timesのスケーリング効率の改善です。提供された抜粋には完全な評価テーブルがありませんが、注目すべき定量的なポイントとしては、総計2.8T / 活性化104Bパラメータ、16/896エキスパート活性化、1Mトークンコンテキスト、そして2.5\timesの計算効率の数値が挙げられます。この効率の主張は、事前学習の目標関数に対するloss vs. FLOPsとして読むべきであり、下流のRL-tuned性能への完全な転移は、改善のどれだけがKDA(loss景観を変える)からか、LatentMoE(パラメータとFLOPの比を変える)からかによって異なります。

制限と未解決の問題

abstractは途中で切れていますが、アーキテクチャの選択はいくつかの未解決の問題を示しています。第一に、KDAはlinear-attentionの変種であり、ハイブリッド化にもかかわらず、1Mトークンでの正確なneedle-in-haystackの検索を必要とするタスクは、歴史的にlinear attentionが劣化する箇所であり、本レポートはperplexityではなくRULERスタイルの評価で精査されるべきです。第二に、2.8TスケールでのKDAを含む16/896ルーティングはロードバランシングlossが安定化できる限界に近く、エキスパートの崩壊や死んだエキスパートについてはabstractでは議論されていません。第三に、マルチドメインRLからの「合成的汎化」は主張されていますが、標準的な失敗モード(あるドメインへのreward hackingが別のドメインに漏洩する)は定量的な処理が必要です。第四に、努力条件付きポリシーはキャリブレーションの問題を提起します。すなわち、トークンがユーザーによって指定されていない場合、モデルは努力を正しく選択するのでしょうか?

この研究の重要性

Kimi K3は、アーキテクチャの変更(linear-attentionハイブリッド、非常に高いエキスパート数での潜在空間ルーティング)が、フィールドが純粋にデータとスケールに縛られているのではなく、2T+ MoEスケールでも乗法的な計算効率の向上をもたらし得ることを示すデータポイントです。2.5\timesという数値が独立した評価でも維持されるなら、KDAスタイルの再帰は、長いコンテキストでフロンティアモデルをトレーニングしている人々にとって無視しがたいものとなります。

Source: https://arxiv.org/abs/2607.24653

独自モデルからオープンソースへ:エージェント型検索におけるマルチエージェントプロトコル蒸留による分布ギャップの橋渡し

問題

エージェント型検索は多段階推論と検索を交互に組み合わせるものであり、成果ベースのRL(例:EM報酬を用いたGRPO)はスパースな軌跡レベルの二値シグナル R(x,y)\in\{0,1\} しか与えません。強力な独自教師モデルからの密な監督は魅力的ですが、標準的な蒸留を阻む二つの構造的障壁があります(図1参照)。教師のlogitは非公開でありtokenizerも異なるため、logitやトークンレベルのKLマッチングは不可能です。また、教師の生の自然言語軌跡をそのまま模倣すると、表面的なスタイル(冗長性、フォーマットの慣用表現)が転移し、学生自身の生成分布が忠実に生成できないトークンへと引っ張られるため、幻覚が誘発されます。

独自教師モデルとオープンソース学生モデルの間の蒸留ボトルネック。

手法

Multi-Agent Protocol Distillation(MAPD)は、教師と学生の間にスタイル正規化された中間表現——Structured JSON Protocol z——を挿入し、プロトコル条件付き蒸留とGRPOを組み合わせます。

Structured JSON Protocol。 各教師軌跡は五つのフィールドに圧縮されます:

  • task_type \in {single_hop, multi_hop, comparison, others}
  • reasoning_plan:順序付きサブゴールリスト
  • grounding_facts:検索されたパッセージからの抽出的証拠スパン
  • partial_findings:検索が収束しなかった場合のオプションの中間結果
  • answer_verification:最終回答と真偽値フラグ answer_grounded

レンダリングされたプロトコル p = f(z) は、学習時のみ、学生モデルの教師条件付きブランチへの特権情報として入力されます。z は教師固有の表現を捨て、構造化された認知的人工物と逐語的な証拠のみを保持するため、学生のネイティブなトークン分布を保ちながら、高レベルの戦略とグラウンディングされた事実を転移させることができます。

マルチエージェント生成パイプライン。 独自モデル上に構築されたオフラインMASが各学習クエリを分解し、検索を実行し、失敗した検索を修復し(EMに到達できない場合に partial_findings を生成)、品質管理フィルターのもとでJSONプロトコルを出力します。これにより、教師の検索では直接解けないクエリに対してもプロトコルが得られます——スパース報酬RLではそのような軌跡を完全に棄却してしまうため、これは非自明なカバレッジ特性です。

MAPDフレームワーク:MASがプロトコルを生成し、プロトコルが教師と学生を橋渡しし、OPSD+GRPOの合同学習が教師の能力を内在化する。

合同目的関数。 学習はオンポリシー系列蒸留(OPSD)項とGRPOを組み合わせます。OPSD項は、学生のプロトコル条件なしのポリシー \pi_\theta(y\mid x) をプロトコル条件付きポリシー \pi_\theta(y\mid x, p) に対してトークンレベルで整合させます。このとき特権教師ブランチを学生自身のtokenizer上のソフトターゲットとして使用するため、異種tokenizer問題を完全に回避できます。複合lossは

\mathcal{L} = \mathcal{L}_{\text{GRPO}} + \lambda\,\mathcal{L}_{\text{OPSD}},

であり、\lambda=0.05 は図3のスイープにより選択されています。この図は明確な逆U字型を示しており、小さすぎると密化の効果が無視できるほど小さく、大きすぎるとRLシグナルを圧倒してポリシーが不安定化します。

OPSDの重み \lambda と平均成功率の関係;1.7Bおよび4Bの両スケールで \lambda=0.05 が最適。

結果

学習にはNQ + HotpotQAのみを使用しており、7つの評価ベンチマークのうち5つはOODです。Qwen3-1.7Bにおいて、MAPDは平均成功率39.4%を達成し、SDAR 37.6%、GRPO+OPSD 30.5%、GRPO 31.6%、vanilla 25.7%を上回ります。Qwen3-4Bでは、MAPDは44.4%に達し、SDAR 43.0%、GRPO+OPSD 38.3%、GRPO 37.4%、vanilla 28.8%を超えます。

二つのパターンが際立っています。第一に、naiveなOPSD単独では壊滅的な結果をもたらします:1.7Bで5.9%、4Bで20.9%——vanillaを下回る結果であり、生の軌跡模倣が学生を劣化させることが確認されます。GRPO+OPSD(生のトレース)でさえ、1.7BではほとんどがちょうどないしわずかにしかGRPOに並びません(30.5 vs. 31.6)。プロトコル表現こそが蒸留を破壊的ではなく加算的にしているのです。第二に、利得はマルチホップのOODタスクに集中しています:Bamboogleは1.7Bで15.0%の相対改善(GRPOに対して22.4→36.8、SDARに対して32.0→36.8)、MuSiQue 5.7%、2Wiki 5.5%。シングルホップの利得は小さく(TriviaQA +0.9%)、複数の検索を連鎖させる必要がある場合に構造化推論計画とグラウンディング事実が最も重要であるという直感と一致しています。

限界と未解決の問題

  • プロトコルスキーマは手動設計であり、五つのフィールドがパレート最適かどうか、あるいは学習された分解がより良く転移するかどうかは未検証です。
  • 全実験はQwen3-{1.7B, 4B}を使用しており、4Bを超えるスケーリング挙動および非Qwenファミリーへの適用は報告されていません。
  • OPSDは教師ブランチをground-truth検証済みプロトコルで条件付けしますが、推論時に学生はプロトコルを持ちません。教師ブランチと学生ブランチのギャップの大きさ、およびテスト時プロトコル予測によってそれを埋められるかどうかは分析されていません。
  • MASパイプライン自体が学習クエリごとに独自モデルの呼び出しを使用しており、純粋なRLと比較した際の教師トークンの総予算は表形式で示されていません。
  • 唯一の報酬および評価指標としてのEMはマルチホップチェーンにおける部分的正解の挙動を不明確にしており、arXiv IDが異常に見える(2607プレフィックス)ことは、プレプリントのバージョン管理の特殊事情またはプレースホルダーのいずれかを示唆しています。

なぜ重要か

MAPDは、logitアクセスとtokenizerの整合が利用できない場合、構造化された中間表現——生テキストではなく——が正しい蒸留インターフェースであり、スパース報酬RLと対立するのではなく、それとクリーンに組み合わせることができることを示しています。これは、教師の内部への特権的アクセスなしに、マルチホップ検索タスクにおいてオープンソースエージェントを独自教師モデルの能力水準へと引き上げるための実践的なレシピです。

Source: https://arxiv.org/abs/2607.24280

StateAct: 長期的なコンピュータ利用エージェントのために、ピクセルより先にプログラム状態を

問題

ほとんどのコンピュータ利用エージェントは、スクリーンを主要な観察対象として扱います。すなわち、VLMがスクリーンショットを読み取り、座標を選択し、クリックするという方式です。StateActは、この方式がデスクトップ自動化における誤ったインターフェースであると主張します。スクリーンショット o_{\mathrm{pix}} = f_{\mathrm{render}}(s) は、基礎となるプログラム状態 s(ファイル、DOM、アプリケーションのバックエンド、スプレッドシートのセル)の損失を伴う非単射的な射影です。ピクセルが同一の二つの状態は、タスクの成否を実際に決定する内容において異なる可能性があります。例えば、「42」と表示されているセルには、リテラル値、丸めた値、あるいは数式が格納されているかもしれません。また、非表示の行やスクリーン外のデータはまったくレンダリングされません。デスクトップタスクの成果物はピクセル上ではなく、保存された状態に対して評価される成功述語 G(s) として s の変化であるため、f_{\mathrm{render}}(s) に基づいて知覚を構築することは、数百ステップにわたってエラーを積み重ねることになります。

同一サブゴールに対するピクセルチャネルと状態チャネルの比較。

形式的には、成果物が非レンダリングコンテンツに依存する場合、一般に G(s)=\tilde{G}(f_{\mathrm{render}}(s)) を満たす \tilde{G} は存在しません。状態チャネル o_{\mathrm{state}}=g(s) — シェルコマンド、openpyxl による読み取り、DOMのシリアライズ — は、タスクが触れるサブ状態に対して事実上可逆であり、実際のアーティファクトを読み書きします。

手法

StateActはコードファーストのマルチエージェントハーネスであり、三つのコンポーネントから構成されます(Figure 2)。

StateActアーキテクチャ:メインコードエージェント、GUI/ブラウザ専門エージェント、finish gate、コンテキストマネージャ。

メインエージェント(状態に対するコード)。 アクション空間は、永続的な bash、ファイルエディタ、画像ファイル用の読み取り専用 view_image、計画チェックリスト、finish アクション、およびエージェント委譲ツールで構成されます。重要なのは、メインエージェントにはマウスもキーボードも公開されていない点です。状態の探索は、アプリケーションが状態を永続化する場所(メールストア、オフィス形式、ブラウザプロファイル、sqlite DB)に関するモデルの事前知識と、find/ls/grep/sqlite3 を用いた能動的なプロービングに依存しています。

GUI/ブラウザサブエージェント。 サブゴールが本当に画面操作を必要とする場合(視覚的レイアウトの確認、スクリプト化できないUI)、メインエージェントはフレッシュなコンテキストを持つ専門エージェントに委譲します。実験的には、GUIサブエージェントは108タスク中わずか28タスクでしか呼び出されず、メインエージェントのステップ数の1.1%しか消費しません。

Finish gate。 独立した検証器が finish 時(少なくとも三つの非finishステップの後)に永続化されたアーティファクトを再読み取りし、最大三回のラウンドを実行します。出力の欠如、未保存、誤ったパス、論理的な不整合といった構造的な失敗を検出します。Figure 5(タスク038)では、ゲートがCRMリードのステータス40件すべてを再導出し、新しいメールによって上書きされた古いレコードから参照されたlead-6を拒否する様子が示されています。エージェントはその後再導出してパスします。

コンテキスト管理。 長期的な処理は、サブゴールをフレッシュなサブエージェントに渡すことで処理し、メインエージェントのコンテキストは計画とタスクの事実に集中した状態を維持します。ターン数の内訳:エピソードあたり約57回のメインエージェントターン、各委譲で約23回の内部ターン(上限50回)が加わり、タスクあたり合計約155回のモデルターンとなります。

結果

Claude Opus 4.8、adaptive thinking、および200ターンのメインエージェントバジェットを用いたOSWorld 2.0(108の長期タスク)での結果:

  • バイナリ成功率:参照CUAハーネス下での同じOpus 4.8の 20.6% に対して 26.9%
  • 平均部分スコア:54.8% に対して 61.6%
  • コスト:~$72/タスク に対して ~$7.8/タスク — より高い精度にもかかわらず、約 9\times 安価。

Paretoプロット:StateActは26.9%かつ~$7.8で、21%未満の公開フロンティアを上回っている。

能力別の分析では、性能向上は状態グラウンディングの議論が予測する箇所に正確に集中しています。Multi-item state では、StateActは27.9/66.7を達成し、次点のGPT-5.5の14.0/50.6を上回っています。Streaming はGPT-5.5の50.0/57.8やSonnet-4.6の0.0/4.7に対して66.7/66.7に跳ね上がっています。Cross-source(26.1/64.9)、Conflict disambiguation(30.8/64.5)、Visual-spatial(31.1/61.3)、および Implicit state(30.2/60.1)はいずれも、バイナリ成功率において最強の非StateActベースラインに対して同様の2〜3倍の差を示しています。唯一の後退は Human-in-the-loop であり、0.0/43.9(GPT-5.5は16.7/43.1)となっており、コードファーストのスタンスが本質的にインタラクティブな交渉には不向きであることを示唆しています。

Figure 5の軌跡は各モードを示しています。タスク012は python-docx/pdfplumber/tesseract を使用してGUIなしで試験問題のバインディング問題全体を解決し、タスク001は .ics カレンダーファイルを直接書き込み、GNOME Calendarを視覚的に確認するためにのみGUI専門エージェントに委譲し、タスク038はgate-retryループを実行します。

限界と未解決の問題

評価は単一のバックボーン(Claude Opus 4.8)と単一のベンチマークのみをカバーしています。状態チャネルの優位性は、アプリケーションが状態を永続化する場所についてモデルが正確な事前知識を持つことに依存しており、これはOSWorldが重視するオフィス/メール/ブラウザスタックに比べて、ニッチまたはクローズドソースのソフトウェアでは弱くなる可能性があります。説明されているfinish gateは構造的なプロパティをチェックするものであり、意味論的な検証は同じモデルの判断に依然として制限されています。Human-in-the-loopの性能低下は、GUIをフォールバック専門エージェントとして扱うのではなく、インタラクティブモードへのエスカレーションを原則的に行う方法をハーネスが必要としていることを示唆しています。論文ではfinish gate、コンテキストマネージャ、委譲ポリシーを個別にアブレーションしていないため、三つのコンポーネント間の寄与の帰属は不明確です。また、find/grep/sqlite3 による「状態探索」は、サンドボックス化された評価環境外ではセキュリティ上センシティブな能力です。

なぜ重要なのか

デスクトップタスクの成果物がプログラム状態であるならば、エージェントにとって適切なインターフェースはピクセルではなく状態チャネルです。StateActは、この再フレーミングが同一バックボーンにおいてより高い成功率(26.9% vs. 20.6%)と約 9\times 低コストの両方をもたらすという直接的な証拠を提供します。これは、画面知覚VLMのさらなるスケーリングが長期的なコンピュータ利用エージェントにとって誤った軸であることを示唆しており、正しい軸はコード、アーティファクトレベルの検証、およびコンテキストの規律にあります。

Source: https://arxiv.org/abs/2607.22798

On-Policy Diffusion Distillationにおけるクラシファイア・フリーガイダンスの再考

問題設定

拡散モデルに対するon-policy distillation(OPD)は、現在のstudentがロールアウトした軌跡に沿ってteacherに問い合わせ、teacherの速度に合わせてマッチングを行います。現代の拡散システムはほぼ常にclassifier-free guidance(CFG)を使用しているため、自然な目標はCFGで合成された速度

v_\gamma = \gamma v_+ + (1-\gamma) v_-,

にマッチングすることです。ここで v_+v_- はそれぞれ条件付きおよび無条件(またはnegativeブランチ)の速度です。本論文は、このデフォルトがブランチレベルで識別不足であり、teacherのnegativeブランチにstudentが参照できない情報が含まれている場合、stduentを密かに劣化させる可能性があると主張しています。

\mathbf{e}_+ = v_+^S - v_+^T および \mathbf{e}_- = v_-^S - v_-^T をブランチ誤差とします。ガイド付き予測のみをマッチングするには

\gamma \mathbf{e}_+ + (1-\gamma)\mathbf{e}_- = \mathbf{0} \;\;\Longleftrightarrow\;\; \mathbf{e}_+ = \tfrac{\gamma-1}{\gamma}\mathbf{e}_-,

が必要ですが、これは無数の非ゼロなブランチ誤差ペアを許容します。この曖昧さが無害かどうかは、条件付け構造に依存します。

ナイーブなCFGベースのOPDはブランチの曖昧さに悩まされます。

Negativeブランチの非対称性

著者らは2つのレジームを区別しています:

  • 共有negativeコンディショニング: teacherとstudentの両方がnegativeブランチで \varnothing を使用する場合(例:\mathbf{c}_T^-=\mathbf{c}_S^-=\varnothing のテキストレンダリング)。ガイド付き誤差を小さくすることで、両ブランチの誤差を同時に減らす傾向があります。
  • 特権negativeコンディショニング: teacherのnegativeブランチにstudentが持たない情報が含まれる場合。参照条件付きFLUX-2-kleinの設定では、\mathbf{c}_T^- = (\varnothing, \mathbf{r}) である一方、\mathbf{c}_S^- = \varnothing です。studentのnegativeブランチは原理的にteacherのそれにマッチングできませんが、合成された目標は \|\mathbf{e}_-\| を大きくして \|\mathbf{e}_+\| の減少を補うことで、式7を満たす解を依然として許容します。

著者らはこの結果として生じる失敗モードをNegative Branch Asymmetry(NBA)と呼んでいます:ナイーブなCFG合成マッチングは拮抗したダイナミクスを生み出し、\|\mathbf{e}_+\|_2 が減少する一方で \|\mathbf{e}_-\|_2 が増加します。2つの誤差が \gamma_{\text{train}} でキャンセルし合うため、この病理は訓練スケールでは見えず、推論時にガイダンスを再スケールした場合にのみ露呈します。

共有コンディショニングと特権コンディショニングにおけるブランチ誤差のダイナミクス。

図2は両方の予測を実験的に確認しています。テキストレンダリングのdistillation(SD3.5-Medium、LoRA rank 32、\gamma_{\text{train}}=4.5)では、ナイーブ、positive-only、PDMの3つの目標すべてが両ブランチの誤差を減少させます。FLUX-2-kleinの参照条件付き設定(\gamma_{\text{train}}=2)では、ナイーブマッチングおよびpositive-onlyのアブレーションでさえ \|\mathbf{e}_+\|_2 を減少させる一方で \|\mathbf{e}_-\|_2 が上昇します;PDMのみがnegativeブランチを安定に保ちます。

Positive-Direction Matching(PDM)

PDMは目標を(i)positiveブランチの速度マッチングと(ii)合成された予測ではなく、実際のCFG更新方向である条件付き方向 v_+ - v_- へのマッチングに分解することで曖昧さを取り除きます。具体的には、PDMは

\ell_{\text{PDM}} = \|v_+^S - v_+^T\|_2^2 + \lambda \,\|(v_+^S - v_-^S) - (v_+^T - v_-^T)\|_2^2

を制約として課します。

studentのnegativeブランチは特権的なteacherのnegativeを文字通り再現できないため、PDMはstudentにteacherの絶対的な v_- ではなく、teacherがCFGを動かしたい方向を再現させます。これは識別可能です:positiveの項が \mathbf{e}_+ を固定し、方向の項が \mathbf{e}_+ - \mathbf{e}_- を固定し、両者が合わさってstudentの表現能力の範囲内で \mathbf{e}_- を固定し、式7の補償的な解を排除します。

定性的証拠

特権参照条件付けにおけるdistillationによるCFG感度。

図3は実際の影響を示しています。FLUX-2-kleinの参照条件付きteacherでは、teacherは推論のガイダンススケール全体にわたって参照スタイルを一貫して保持します。PDMでdistillationされたテキストのみのstudentはこの挙動を忠実に追跡します。同じ \gamma_{\text{train}}=2 で訓練されたナイーブマッチングのstudentは、可視的なスタイルのドリフトと構造的な歪みを示します。これは \gamma=1 で最も深刻であり、そこではCFG合成が \mathbf{e}_- を最大限に重み付けし、蓄積されたnegativeブランチ誤差が完全に露呈します。これがNBA分析で予測された「訓練スケールでは隠れており、再合成時に露呈する」という特徴的なシグネチャです。

注目すべき実験設定の詳細

  • テキストレンダリング:SD3.5-Medium ベース、MM-DiTのすべてのself-attentionおよびcross-attentionブロックのQ/K/Vおよび出力プロジェクションに対してLoRA r=32,\alpha=64;LoRAのみを訓練。TeacherはDiffusionOPD OCR teacher。1,018件のheld-outプロンプトで評価。
  • 参照コンディショニング:FLUX-2-klein-base-4B、\gamma_{\text{train}}=2、推論ガイダンススケールのスイープ全体で評価。
  • Positive-onlyアブレーション(\ell_+ = \|\mathbf{e}_+\|_2^2)は最適化の診断としてのみ使用されています;これは、特権コンディショニングの下では、lossからnegativeブランチを除去しても \|\mathbf{e}_-\|_2 の増加を防げないことを示しており、on-policy軌跡のシフトがブランチを暗黙的に結合するためです。

限界とオープンな問題

診断は参照条件付き側では主に定性的であり、本論文はブランチ誤差の軌跡と並排の生成物に依拠しており、標準化されたスタイル忠実度メトリクスを使用していません。理論的な記述(式7)は教師あり状態での一次条件であり、勾配ダイナミクスがなぜ拮抗的な解を好むのかを単独では説明できません;本論文はこれを経験的観察に委ねています。方向マッチングの重み \lambda とその \gamma_{\text{train}} との相互作用は完全に特徴付けられていません。また、「negative」ブランチがまったくnull条件ではない他のガイダンス変形(例:autoguidance、perturbed-attention guidance)においてPDMがどのように相互作用するか、およびより複雑な条件付けスタックを持つ動画・音声拡散においてNBAが発生するかどうかも不明です。

なぜこれが重要か

CFG合成マッチングは拡散distillationにおいて暗黙のデフォルトとなっていましたが、本論文はteacherのnegativeブランチが特権的な信号を持つ場合——参照画像、被写体、または制御条件付けを伴う、ますます一般的なレジーム——には密かに識別不足であることを示しています。PDMは識別可能性を回復しteacherのガイダンススケール挙動を保持する、小さく機械的な修正であり、これはまさに実践者が実際に展開する際に求める特性です。

Source: https://arxiv.org/abs/2607.24731

Sol-Attn: On-the-Fly Attention Sparsificationによる動画生成推論の高速化

問題設定

動画拡散transformer(DiT)は、数十フレームにわたって空間パッチを展開すると10^5要素を超えるトークン系列を扱います。AttentionのコストはO(N^2 d)でスケールし、HunyuanVideoやWanなどの最新モデルではエンドツーエンドの推論レイテンシを経験的に支配しています。学習不要な動的sparse attention――各クエリが実行時に選択されたkey/valueブロックのサブセットにのみattendする方式――は、再学習を不要とし、サンプルごとに適応できることから魅力的です。しかし、既存の動的sparseスキームには次の2つの失敗モードがあります。

  1. 硬直的またはコストの高いルーティング。 プロキシスコア(例:クエリに対するmean-pooledキー)を使用したTop-kブロック選択は、クエリごとに固定バジェットを課すため、attentionが鋭く集中している箇所では計算を無駄にし、拡散している箇所では質量を失います。累積質量ルーティング(\sum p_i \ge \tauになるまでブロックを保持)は動的バジェットを与えますが、完全なプロキシ分布を具現化してソートする必要があり、長いコンテキストではそのオーバーヘッドが無視できなくなります。
  2. 未選択ブロックのハードドロップ。 未選択ブロックの寄与をゼロに設定すると、softmaxの正規化項と出力にバイアスが生じ、このバイアスが層や拡散ステップをまたいで蓄積されます。積極的なスパーシティ(例:80%超)下では品質が崩壊します。

Sol-Attn(Sparsifying online attention)は、単一の融合online-softmaxカーネル内でこれら両方の問題に対処します。

手法

標準的なFlashAttentionスタイルのonline softmaxは、key/valueブロックB_jを順番に処理し、実行中の最大値m、指数和\ell、非正規化出力Oを保持します。クエリ行qとブロックjのスコアs_j = q K_j^\top / \sqrt{d}に対して:

m_j = \max(m_{j-1}, \max s_j), \quad \ell_j = e^{m_{j-1}-m_j}\ell_{j-1} + \sum e^{s_j - m_j}, \quad O_j = e^{m_{j-1}-m_j} O_{j-1} + e^{s_j - m_j} V_j.

Sol-Attnはこのループに3つの変更を加えます。

別途プロキシパスを必要としないオンザフライルーティング。 全ブロックにわたってプロキシスコアを事前計算する代わりに、Sol-Attnは現在のブロック自身の要約統計量を使用します――完全なq K_j^\topが具現化される前にブロックヘッダーで推定される\max s_jおよび平均s_jから安価に導出可能――そして(a)ブロックを完全に計算する、(b)近似する、または(c)スキップするかを決定します。ルーティングはonline-softmaxスキャンと融合されているため、プロキシスコアの補助テンソルはHBMに書き込まれません。バジェットは暗黙的に動的です:鋭く集中したクエリは早期にブロックの展開を停止し、拡散したクエリはより多くを許容します。

ハードドロップの代わりに近似補正を実施。 「近似」に分類されたブロックに対して、Sol-Attnはブロックレベルの要約(ブロック平均キー\bar{k}_jおよびブロック平均値\bar{v}_j)から導出した推定\hat{\ell}_jおよび\hat{O}_jを寄与させます:

\hat{s}_j \approx q \bar{k}_j / \sqrt{d}, \quad \hat{\ell}_j \mathrel{+}= B \cdot e^{\hat{s}_j - m}, \quad \hat{O}_j \mathrel{+}= B \cdot e^{\hat{s}_j - m} \bar{v}_j,

ここでBはブロックサイズです。これにより、ブロック内分散が低いブロックに対してsoftmax正規化項が期待値においてバイアスなしに保たれ、純粋なkeep-or-dropルーティングの質量漏れを回避します。上限スコア\max s_jが実行中の最大値を大きく下回るスキップされたブロックは何も寄与しないため、テール部分ではtop-kの動作に一致します。

統合単一パスカーネル。 ルーティング決定、厳密計算、近似、softmax更新がブロックごとに1回のループイテレーション内で行われるため、制御フロー、メモリ読み込み、演算が償却されます。プロキシ計算は別途カーネルを起動しません。

結果

本論文はHunyuanVideoおよびWanクラスの動画DiTを対象に報告しています。アブストラクトおよびセットアップからの主要な主張:

  • Sol-Attnは、top-kおよび累積質量ベースラインに対してParetoで優れた精度対スパーシティ曲線を達成します。同等のVBench / PSNR品質において、より高いスパーシティで動作し、同等のスパーシティでは、より多くの品質を保持します。
  • プロキシパスの排除により、他の動的sparseメソッドが被るオーバーヘッドが除去され、ルーティングの「紙上の節約」がカーネルにおける実測のスピードアップに転換されます。
  • 近似補正は積極的スパーシティ領域を可能にするコンポーネントであり、これを取り除くとkeep-or-dropメソッドの精度崩壊が再現されます。

(具体的なスピードアップ比およびVBenchのデルタは論文の実験に引用されており、アブストラクトはルーティング、sparse計算、補正の統合を利得の源として強調しており、単一の数値ではありません。)

制限と未解決の問題

  • ブロック平均近似は、ブロック内のキーと値が適度に均質であることを前提とします。動画DiTではトークンがパッチ順に並んでいるためこれは成立しますが、置換または大きく混合されたトークン順(例:特定の位置シャッフルやMoEルーティング後)のモデルでは近似誤差が増大します。
  • ブロックレベルの統計量からのルーティング決定は、ブロックが無関係なキーに囲まれた単一の鋭いキーを含む場合にバイアスが生じる可能性があります。最大スコア推定は助けになりますが、形式的な誤差上限は与えられていません。
  • 本手法は学習不要であるため、ベースDiTが生成するattention分布をそのまま継承します。将来のモデルがより密なattentionパターン(例:長距離グローバルトークン)で学習された場合、スパーシティの余地は縮小します。
  • 他の推論時高速化(拡散ステップをまたいだキャッシング、ステップ蒸留、量子化)との相互作用は十分に特性評価されていません。

重要性

動画DiTにおける長コンテキストattentionは現在の推論ボトルネックであり、学習不要の節約はすべて数十のデノイジングステップにわたって複利的に効いてきます。Sol-Attnの貢献はモデルではなくカーネルのアーキテクチャ的なものです。ルーティングと残差近似を単一のonline-softmaxパスに折り込むことで、通常は動的sparseの利得を食い潰すオーバーヘッドを排除し、再学習なしに利用可能なスパーシティのフロンティアをより高く押し上げます。

Source: https://arxiv.org/abs/2607.24027

Hacker News Signals

$500のRL fine-tuneで9Bオープンモデルがフロンティアモデルをカタログレビューで上回った

FermiSenseの実務家が、Eコマースのカタログレビューという特定のタスク——製品リストが構造化された品質基準を満たしているかどうかの確認——に向けて9Bオープンウェイトモデルをreinforcement learningでfine-tuningし、コストをわずかに抑えながらGPT-4クラスのフロンティアモデルを上回ったことを報告しています。総コンピュート費用はおよそ$500でした。

手法はGRPO/アウトカム教師あきRLのレシピに従っています:入力ごとに複数のrolloutを生成し、検証可能なreward signal(カタログルールはブール値またはそれに近い形式:タイトルにブランド名が含まれているか、説明文がN文字以内か、必須属性が存在するか)に対してスコアリングし、高いrewardの出力の確率が上がるようにpolicyを更新します。これはまさにRL fine-tuningがSFTとprompt engineeringを上回るケースです——つまり、プログラム的に評価できるground truthのコストが低く、タスクの分布が狭い場合です。

主な技術的ポイント:(1) reward functionは学習されたものではなく、小売業者のスタイルガイドに基づいて手動でコーディングされています——これがシグナルを信頼できるものにしています。(2) 9Bというパラメータ数は、単一のA100ノードで数時間以内にGRPOが実行可能なスイートスポットに位置しています。(3) フロンティアモデルとの比較では同じ構造化promptを使用し、fine-tunedモデルはホールドアウトされたSKU全体でprecision、recall、および一貫性の指標において勝利しました。

この投稿は、一般化できない点についても正直に述べています:このモデルはカタログドメイン外では脆弱であり、このアプローチにはreward functionを記述できるほど精密な既存のルールセットが必要です。また、良いpromptテンプレートを構築するために必要なデータキュレーションの作業についても軽く触れるにとどまっています。

より広い教訓は平凡ですが重要です:正確性がプログラム的に検証可能であり、入力の分布が安定しているあらゆるタスクに対して、小規模なオープンモデルへの狭いRL fine-tuneは、汎用フロンティア推論を限界コストで10〜100倍低く抑えながら日常的に上回るでしょう。コストがかかるのはreward functionのスコーピングであり、コンピュートではありません。

Source: https://fermisense.com/when-machines-take-the-wheel/


テレンス・タオ:AI時代における数学

タオのICM 2026講演スライドは、AIが現在数学研究とどのように交差しているかについて、冷静かつ技術的に根拠のある見解を示しています。議論は、それぞれ異なる精度要件を持つ3つの異なるユースケースを軸に構成されています。

第一に、数学文献に対する検索・検索レイヤーとしてのAI——この点においてLLMはすでに価値を提供していますが、ハルシネーションによる引用や微妙に誤った定理の記述が真のリスクとなるという注意点があります。タオは、数学者であれば出力内容を妥当性検証できると指摘しつつも、非専門家にとってはその失敗モードが潜在的で見えにくいと述べています。

第二に、AI支援による形式化:LLMの提案を用いてLean/Mathlibの証明作成を加速すること。タオはここでは慎重ながらも楽観的な見方を示しています。自動補完と戦術提案は形式化の摩擦を大幅に軽減し、モデルが生成した候補によって証明探索が有意義に加速された最近のプロジェクトをいくつか挙げています。制限要因はモデル自体ではなく、機械的に検証可能な中間補題の大規模コーパスが存在しないことです。

第三に、研究レベルの問題に対する自律的な証明生成。タオは明確に述べています:最良の reasoning model を含む現在のシステムは、真に新規なアイデアの組み合わせを必要とする問題では失敗します。オリンピアードスタイルの問題では良好なパフォーマンスを発揮しますが、それはそのような問題がtraining dataに多く含まれており、比較的浅い探索木で解けるためです。オリンピアード性能とフィールズ賞レベルの業績との間のギャップは、スケールの問題ではなく——アーキテクチャの変更や新しいtraining paradigm、おそらくはループ内に形式的検証を組み込んだ木構造探索に近いものを必要とするでしょう。

タオはさらに、十分に評価されていない点として、たとえ完全な形式的検証器が存在したとしても、証明すべき適切な予想を見つけるという問題は解決されないと指摘しています。数学の進歩は、証明探索と同様に、センスと問題選択においてもボトルネックになっています。

スライドは内容が濃く、直接読む価値があります。これは誇大宣伝的な記事ではありません。

Source: https://teorth.github.io/tao-web/slides/age-of-ai-icm-2026.pdf


PyTorch: リファレンス言語として

PyTorchコンパイラチームの開発者ブログ記事は、明示的な再定義を主張しています。すなわち、PyTorchのeagerモードはパフォーマンスの目標ではなく、リファレンス言語仕様として扱われるべきであり、コンパイラスタック(torch.compile、Inductor、Triton)が実際の実行レイヤーであるという考え方です。

技術的な核心は、このフレーミングが何を正当化するかにあります。リファレンス言語のセマンティクスは、autogradを伴うeager Pythonの実行によって定義されます——すべてのオペレータはPythonレベルでの標準的な振る舞いを持っています。コンパイラは、観測可能な出力が浮動小数点の許容誤差の範囲内でリファレンスと一致する限り、自由に書き換え、融合、並べ替え、ハードウェア固有のカーネルへの変換を行うことができます。これは、Cがコンパイラバックエンドのリファレンスとなっている方式と類似しています。Cでセマンティクスを記述し、コンパイラがISA固有のコードを生成するという関係です。

実用的な観点では、これはPyTorchエコシステムにおける長年の緊張関係を解消します。カスタムオペレータを記述したり数値のデバッグを行ったりするユーザーは、丸め誤差の範囲でeager == compiledが成立することを信頼できる必要があります。本記事では、両方のパスを実行して乖離を検出する体系的なテストハーネスに関する取り組みが紹介されており、コンパイラが本番訓練において信頼されるためには不可欠なインフラです。

また、torch.compileにおけるオペレータ分解の根拠も説明されています。複合オペレータはプリミティブに分解されることで、そのリファレンスセマンティクスの仕様が簡潔になります。たとえ分解によってグラフノードが増加するとしても同様です。リファレンスの正確性は、分解ツリーの最小化よりも優先されます。

このフレーミングは新しいハードウェアバックエンドにも示唆を与えます。バックエンドはプリミティブオペレータセットにおけるリファレンスセマンティクスを満たすだけでよく、eagerの内部実装を模倣する必要はありません。XLA、MPS、およびカスタムアクセラレータバックエンドが、PyTorch全体を再実装することなく構成可能性を得られるのはこのためです。

短い記事ですが、このフレーミングはコンパイラスタックにおけるこれまで理解しにくかった多くの設計上の決定を明確にしています。

Source: https://docs.pytorch.org/devlogs/compiler/2026-07-25-pytorch-a-reference-language/


GoのヒープをたどるGCの新旧比較観察

本稿は、Goの古典的な三色マーク・アンド・スイープ方式の並行GCと、最近のGoバージョン(Go 1.24以降を対象)で導入された新しいガベージコレクタを詳細に比較した観察記事です。新しいGCはリージョン化された世代に隣接するアプローチを採用しています。著者は実際のワークロードを計測し、GCの停止時間、ヒープスキャン、write barrierのオーバーヘッドを可視化しています。

主要なメカニズムの違いは次の通りです。旧GCはグローバルなマークキューを維持し、各サイクルで到達可能なヒープ全体をスキャンします。write barrierは並行ミューテーション中に三色不変条件を保持します。新しいコレクタはヒープリージョンという概念を導入しており、各リージョンを独立して回収できるため、1GCサイクルあたりのワーキングセットを削減し、停止時間の局所性を改善します。これは従来の意味での完全な世代別GCではありません。Goのエスケープ解析がすでにnursery領域へのプレッシャーを低減しているためです。しかし、スキャン作業を時間的により均等に分散することができます。

著者のワークロードにおける観測結果: GCの中央値停止時間が約1.2msから約0.3msへ短縮し、99パーセンタイルは約8msから約1.1msへ低下しました。スループットへの影響はほぼ中立であり、これはトータルの作業量が同程度でありながらスケジューリングが改善されているためであり、予想通りの結果といえます。write barrierのオーバーヘッドは、ミューテーター実行中においてGCに起因するコストの中で引き続き支配的な要素となっています。

本稿ではpprofとruntime/traceの出力を丁寧に解説し、時間がどこに費やされているかを明確に示している点が教育的な価値を持ちます。ミューテーターのgoroutineと並行マークフェーズが交互に実行される様子の可視化は非常にわかりやすいものです。

言及されている限界点:新しいコレクタはリージョンあたりのメタデータオーバーヘッドが大きく、ヒープサイズが非常に小さい場合には問題になります。リージョン化のヒューリスティクスはサーバーワークロード向けに調整されており、アロケーションパターンが異なる組み込みやバッチワークロードでは同様の停止時間改善が得られない場合があります。

Source: https://theconsensus.dev/p/2026/07/19/observing-gos-garbage-collector-old-and-new.html


LLMに確信度スコアを尋ねてはいけない

「0から100のスケールで、どの程度確信していますか?」というプロンプトをLLMに与え、得られた数値を較正済み確率として扱うという一般的なパターンに対する、焦点を絞った技術的批判です。

核心的な主張は、これらのスコアは意味のある意味での確率ではない、というものです。較正済み確率 p は次の条件を満たすべきです:確率 p を割り当てたすべての主張のうち、おおよそ割合 p が真であること。LLMが生成した確信度の数値は、いくつかの構造的な理由からこの検証に失敗します:(1) スコアは回答を生成したのと同じコンテキストから自己回帰的に生成されるため、回答を導いたバイアスや誤りをそのまま引き継ぐ;(2) モデルは自身の内部的な不確実性に直接アクセスできない――最終的な回答トークンに対するトークン確率の方が、依然として不完全ではあるものの、より良いプロキシである;(3) 数値を求めるプロンプトは認識論的状態ではなく、表面的なフレーミングに引きずられる。

この記事では、これを言語化された不確実性表現(「確信はないですが…」)と区別しています。後者は集計すると何らかの較正シグナルを持ちます。また、モデル自身の回答トークンに対する確率分布から導出されるlogitベースの不確実性推定とも区別しています。こちらは少なくともメカニズム的な根拠を持ちます。

実践的な推奨事項:不確実性の定量化が必要な場合は、回答系列の対数確率 \sum_t \log p(x_t | x_{<t}) をプロキシとして使用するか、ensemble・マルチサンプル手法を用いて出力の分散を測定してください。これらも不完全ですが、モデルの不確実性との間に擁護可能な関連性があります。LLMが生成した0から100の整数にはそれがありません。

較正に関する文献ではよく知られた指摘ですが、本番のLLMパイプラインでは頻繁に無視されています。いくつかの例を交えた、簡潔かつ実証的に根拠のある記事です。

Source: https://justinflick.com/2026/07/27/llm-confidence-scores.html


MAI-Cyber-1-Flash の MDASH への統合

MicrosoftはMAI-Cyber-1-Flashを発表しました。これはMDASH(Microsoft Defender Automated Security Hardening)に統合されたセキュリティ特化型モデルです。技術的な内容は「サイバー特化」がアーキテクチャ上で何を意味するか、そしてMDASHが実際にそれをどのように活用するかを中心に展開されます。

MDASHはMicrosoftが提供するエンタープライズテナント向けの自動攻撃面縮小システムです。Defender XDR、Entra、Intuneからのシグナルを取り込み、設定ミスや露出チェーンを推論し、自動または人間の承認のもとで適用可能な修復アクション(ポリシー変更、Conditional Accessルールの修正、露出スコアの低減など)を生成します。MAI-Cyber-1-Flashの統合により、このパイプラインの推論層が提供されます。

このモデルはセキュリティドメインのコーパス(CVEの説明、脅威インテリジェンスレポート、攻撃チェーングラフ、修復プレイブック)でfine-tuningされたものとして説明されています。深いリサーチタスクではなくインラインの意思決定支援に適した「Flash」(小規模・低レイテンシ)バリアントとして位置づけられています。発表ではパラメータ数やアーキテクチャの詳細は開示されていません。

システム的な観点から興味深いのはエージェントループです。モデルは構造化されたコンテキスト(アセットグラフ、現在のポリシー、観測されたシグナル)を受け取り、修復アクションの優先度付きリストを根拠とともに生成する必要があります。この際、MDASHが実際に実行可能で、かつ可逆性があり、スコープ内のアクションに制約されます。これはオープンエンドな推論ではなく、アクション空間がMDASHの実行能力によって限定された制約付きアクション生成問題です。

セキュリティ固有のfine-tuningがここで重要な意味を持つのは、汎用推論モデルが構文的には妥当でも意味的に誤った修復手順(例えば、存在しないレジストリキーの推奨や、ロックアウトを引き起こすConditional Accessポリシーの組み合わせ)を幻覚することがあるためです。ドメインfine-tuningにより、既知のプレイブックパスにおけるこの種のエラーが低減されますが、新規の攻撃面については依然として課題が残ります。

Source: https://microsoft.ai/news/introducing-mai-cyber-1-flash-inside-mdash/


実数はどれほど「実在」するのか?(2004年)

Chaitinの2004年の論文は、実数の連続体が数学的に意味のある対象なのか、それとも物理的・計算的に実現可能なものを大幅に超えた形式的な便宜に過ぎないのかという問いを再考するものです。技術的な核心は、アルゴリズム情報理論と、それが解析学の基礎に対して持つ含意にあります。

中心的な題材となるのはChaitinの定数 \Omega、すなわち普遍前置符号なTuringマシンの停止確率です:\Omega = \sum_{p \text{ halts}} 2^{-|p|} \Omega[0,1] における well-defined な実数であり、正規数(そのビット列はあらゆる計算可能なランダム性テストをパスする)でもありますが、有限個のビットしかアルゴリズムによって計算できません。これは最大限にアルゴリズム的にランダムであり、そのKolmogorov複雑性は K(\Omega_{1:n}) \geq n - O(1) を満たします。

Chaitinの主張は次の通りです:ほとんどの実数は \Omega と同様に——計算不可能であり、有限の記述を持ちません。解析学で実際に使われる実数(有理数、代数的数、\pie、計算可能実数)は測度ゼロの部分集合に過ぎません。古典的な解析学は、「ほとんどすべての」要素がいかなる有限記述や計算によっても到達不可能である連続体の上にその構造全体を築いているのです。

Chaitinは厳密な有限主義や構成主義の立場を主張しているわけではなく、むしろ数学に対して物理学ベースあるいは情報理論的な基礎を採用した場合に異なる様相を呈するのではないかという問いを提起しています——おそらくはWeihrauchやBishopの意味での計算可能解析、あるいは何らかの有界複雑性クラス内で定義可能な構造への制限を伴うかもしれません。

本論文は短く読みやすい内容です。HNのコメント欄では構成的数学の文献や、ZFCにおける「存在する」と「構成可能である」の区別について真剣な議論が交わされています。BishopによるConstructive Analysisや、Pour-ElとRichardsによる解析学における計算可能性の研究と併せて読む価値があります。

Source: https://arxiv.org/abs/math/0411418


レジデンシャルプロキシは国家安全保障上の脅威である

本記事は、レジデンシャルプロキシ産業——コンシューマー向けデバイス(ルーター、IoT機器、携帯電話)が、多くの場合に実質的なインフォームドコンセントなしに、商用プロキシネットワークの出口ノードとして登録される産業——が、一般的に議論される不正利用のユースケースを超えたインフラレベルの安全保障上のリスクを構成すると主張する、技術的に詳細な投稿です。

その仕組みは以下の通りです。プロキシネットワーク事業者は、SDKベンダーやバンドルソフトウェアの配布業者に対価を支払い、正規アプリにプロキシクライアントコードを組み込みます。ユーザーが無料のVPN、ゲーム、またはユーティリティをインストールすると、そのアプリがデバイスをプロキシ出口ノードとして登録します。そのデバイスのIPアドレスは、住宅用ISPの割り当てとしての評判を持つため、トラフィックがデータセンターのレンジではなく一般の住宅ユーザーから発信されているように見せたい顧客に販売されます。

国家安全保障上の問題として提示される根拠は、いくつかの脅威ベクターに基づいています。第一に、国家支援のアクターが米国の住宅用IPを経由して偵察や侵入トラフィックをルーティングするためにレジデンシャルプロキシアクセスを購入できるため、帰属の特定とブロッキングが著しく困難になります——標準的な防御手段であるデータセンターIPのブロックリストが無効化されます。第二に、登録されたデバイスの集合ネットワークは、大規模な協調トラフィックに利用できる分散インフラを構成しており、利用規約の範囲内で動作するボットネットと機能的に同等です。第三に、対象デバイス——特に住宅用ルーターおよびIoT機器——は、純粋な出口ノードモデルでは捉えきれない、より高いレベルのネットワークアクセス(内部LANの可視性、スプリットルーティング)を持つ可能性があります。

本記事は、特定のプロキシネットワーク、そのSDK配布チェーン、および開示された利用規約と実際のデバイス動作のギャップを詳述しています。技術的な証拠としては、トラフィックキャプチャと、プロキシ登録ロジックを示す逆コンパイル済みSDKコードが含まれます。

政策上の問題点は、この産業がほとんどの法域において合法的に運営されており、登録されたデバイスは従来のマルウェアという意味では「侵害」されていないという点にあります。

Source: https://jacob.gold/posts/residential-proxies-are-a-national-security-threat/

注目の新着リポジトリ

Brain0-ai/brain0

AIが生成したコードに対するプロvenanceおよび監査レイヤーです。中心的なアイデアは、既存のワークフローを変更することなく、すべてのリポジトリコミットをそれを生成したエージェントのプロンプトに遡及できる、パッシブな決定グラフです。技術的には、現在のコードベースの状態を記録されたインテントグラフと比較することでドリフト検出を行い、コードが対応するエージェントプロンプトのトレースなしに変化した場合に乖離を検知し、生成時にエージェントがどのコンテキストを参照することを許可されていたかについてDLPポリシーを適用します。Provenance attestationは暗号署名されており、監査証跡が改ざん困難な形で保持されます。MCP(Model Context Protocol)メモリインターフェースにより、コーディングエージェントが過去の決定を照会できるため、将来のエージェント実行が過去のアーキテクチャ上の選択と整合性を保てます。ツールはデフォルトでオフライン動作し、シングルコマンドでセットアップ可能です。これはエアギャップ環境や規制対象環境において重要な特性です。主要なユースケースは、自律的なコーディングエージェントを大規模に展開している組織におけるコンプライアンスとフォレンジクスであり、「何が変わったか」ではなく「なぜこのコードが存在し、誰が(あるいは何が)それを承認したのか」という問いに答えることを目的としています。

Source: https://github.com/Brain0-ai/brain0


olemeyer/rocketplaneIO

Kubernetesクラスターを対象とした、セルフホスト型のSREオートメーションプラットフォームです。observabilityレイヤーはカーネルレベルでアタッチされたeBPFプローブを使用しており、アプリケーション側のインストルメンテーション、サイドカーインジェクション、SDKの変更は一切不要です。カーネルがシステムコール、ネットワークフロー、プロセスイベントを透過的にキャプチャします。コパイロットコンポーネントはこれらのシグナルを処理し、クラスターの状態を推論した上で、ガードレール付き実行モデルを通じて修復アクションを提案または実行します。アクションは適用前に自己検証されるため、影響範囲を最小限に抑えます。このアーキテクチャはLLM非依存(モデルは持ち込み可)であり、エアギャップ環境へのデプロイを想定して設計されている点が、SaaSのobservability製品との差別化要因となっています。ゼロインストルメンテーションのeBPFテレメトリと自律的な修復ループの組み合わせは、技術的に意欲的なアプローチです。eBPFはオーバーヘッドなしにリッチかつ低レイテンシなシグナルを提供し、ガードレールレイヤーが本番環境における自律的なアクションを許容可能なものにしています。ベンダーロックインやデータエグレスなしにKubernetesのオートパイロット機能を求めるプラットフォームエンジニアリングチームに適しています。

Source: https://github.com/olemeyer/rocketplaneIO


deerwork-ai/deer-workflow

制御フローをTypeScriptで記述し、セマンティックな実行をスワップ可能なAgent runtimeに委譲する、グラフベースのエージェントオーケストレーションruntimeです。アーキテクチャ上の分離が鍵となる設計上の決断です。グラフトポロジー(ノードの依存関係、分岐、並列性、リトライロジック)はTS上で決定論的に処理される一方、LLMを背後に持つエージェントノードは定義されたインターフェースに準拠した交換可能なブラックボックスとして扱われます。これにより、オーケストレーションロジックとpromptエンジニアリングを同一レイヤーで混在させるという一般的な失敗パターンを回避でき、モデルの入れ替え、サブグラフの独立したテスト、あるいはモデルの振る舞いとは独立した制御フローの監査が容易になります。TypeScript runtimeはグラフのエッジおよびノードのコントラクトに対して強い型付けを提供します。Pythonを中心としたフレームワーク(LangGraph、Temporalベースのエージェントなど)と比較して、TSネイティブなアプローチは既存のNode/Next.jsバックエンドスタックと自然に統合できます。エージェント実行レイヤーの柔軟性を犠牲にすることなく再現性のあるオーケストレーションを求める、マルチステップのアジェンティックパイプラインを構築するエンジニアリングチームを対象としています。

Source: https://github.com/deerwork-ai/deer-workflow


EXXETA/exxperts

永続的かつガバナンスが効いたAIコラボレーションルームのためのローカルファーストシステムです。中核的なメカニズムは承認ゲート付きメモリです。ルーム内で動作するエージェントはメモリへの書き込みを提案できますが、その書き込みは永続的な状態にコミットされる前に人間による明示的な承認を必要とします。これにより、文脈が無制限に蓄積されるのではなく、監査可能なhuman-in-the-loopのメモリグラフが形成されます。ルームは独立したスコープであり、それぞれ固有のメモリと参加者の状態を管理します。すべてがユーザーのマシン上で動作するため、データがローカル環境の外に出ることはなく、厳格なデータレジデンシー要件を持つ組織にとって重要な特性となっています。メモリが変更可能でありながらもゲートで制御されるガバナンスモデルは、現在のマルチエージェントフレームワークにおける実際のギャップに対処するものです。既存のフレームワークは通常、永続メモリを持たないか、エージェントが自由に書き込めるかのどちらかです。「永続的AIルーム」という抽象化は、単純なチャットセッションよりもガバナンスの効いた共有ワークスペースに近く、文書作成、コードレビューのワークフロー、継続的な分析プロジェクトなど、長期にわたる共同作業タスクに適用できます。

Source: https://github.com/EXXETA/exxperts


gokulrajaram/ProductSpec

AIエージェントが確実に利用・解釈・実行できる形でソフトウェアの意図を表現するために提案されたオープン仕様フォーマットです。その動機は、現在ソフトウェア要件を記述するために使われている成果物(PRD、チケット、Wiki)が人間の読者を対象として書かれており、LLMベースのエージェントにとっては構造的に曖昧であるという点にあります。ProductSpecは意図のための機械可読スキーマを定義し、目標・制約・受け入れ基準・依存関係を構造化されたフォーマットで記述することで、エージェントが自然言語解釈による情報損失なしにパースできるようにします。このアナロジーはRESTインターフェースにおけるOpenAPIに相当します。すなわち、意図の生産者(プロダクト、エンジニアリング)と消費者(coding agent、テスト生成エージェント、ドキュメント生成エージェント)を分離する契約レイヤーです。このような標準が採用されれば、エージェントのツールチェーンがスコープについて推論し、要件間の競合を検出し、検証可能な完了基準を生成できるようになります。このリポジトリは現在、成熟した実装ではなく仕様策定および議論の段階にあるため、新興標準に影響を与えたいと考えるAIネイティブな開発ワークフローを設計しているチームに主として関連するものです。

Source: https://github.com/gokulrajaram/ProductSpec


SuperJJ007/CSSwitch

Claude Code(AnthropicのCLIコーディングアシスタント)のAPI呼び出しをインターセプトし、任意のOpenAI互換またはAnthropic互換エンドポイントへリダイレクトするプロキシ/アダプタ層です。対応バックエンドには、DeepSeek、Qwen(通義)、Zhipu GLM、Moonshot(Kimi)、MiniMax、Xiaomi MiMo、SiliconFlow、OpenRouterのほか、いずれかのAPI規約に準拠したセルフホスト型エンドポイントが含まれます。仕組みとしては、ローカルリクエストインターセプタがClaude APIのスキーマをターゲットプロバイダのスキーマへリアルタイムで変換し、認証ヘッダ、モデル名のマッピング、リクエスト/レスポンス形式の構造的差異を処理します。これは、Anthropicへのアクセスが制限されている地域のユーザー、コスト裁定(より安価な推論プロバイダへのルーティング)、あるいは異なるベースモデル間でClaude Codeのエージェント挙動をベンチマークする用途において実用的です。ワンコマンドのセットアップにより、深い統合作業を要さないドロップイン型として位置づけられています。主な技術的リスクは、AnthropicがClaude APIのインターフェースを更新した際に生じるスキーマのずれです。

Source: https://github.com/SuperJJ007/CSSwitch


yuwen-cool/yuwen-publish-precheck

中国のソーシャルメディアプラットフォーム(抖音/TikTok中国版、小紅書/RED、微信視頻号)向けのコンテンツコンプライアンス事前審査ツールです。本システムはLLMを使用して、72件の公式規制引用から作成されたルールセットに対してコンテンツを分類し、ポリシー違反のリスクがある特定のフレーズや文章を特定して、書き換え提案を提供します。主要なエンジニアリング上の設計判断は以下の通りです:(1) ユーザー固有の違反履歴を蓄積するローカルルールデータベースにより、フィードバックを通じて時間とともに精度が向上する;(2) 結果が既知の38件の実際のコンテンツサンプルに対するキャリブレーションにより、分類器の決定境界をゼロショットLLMの判断のみに頼るのではなく実証データに基づかせる;(3) フラグが立てられた各項目に対して規制根拠を明示することで、推論を不透明にせず監査可能にする。本システムは承認を保証せず、規制回避の方法も教示しません――これはリスク低減ツールであり、悪用のためのツールではありません。ローカルルール蓄積の設計は技術的に興味深い部分であり、使用量とともに検索コーパスが成長するretrieval-augmentedなコンプライアンスエンジンとして機能します。

Source: https://github.com/yuwen-cool/yuwen-publish-precheck


wzn1118/AsteriaAnalyst

FastAPIバックエンドとNext.jsフロントエンドで構築され、Windowsへの展開を対象としたエンタープライズ向けデータ分析ワークベンチです。設計上の重要な特徴は追跡可能な根拠にあります。すべての分析出力(統計サマリー、可視化、レポートセクション)は、それを生成した特定のデータ行と計算処理に紐付けられており、結論からソースデータへと至る監査チェーンを形成します。これは、LLMが生成した分析において出力が一見もっともらしく見えるものの検証できないという、よくある失敗パターンへの対処です。「Analysis Lab」インターフェースは、探索的統計や可視化構築のためのインタラクティブな環境を提供し、レポート生成レイヤーは管理職向け文書として統制された出力をまとめ上げます。クラウドSaaSではなくWindowsローカル展開モデルを採用しているため、データの所在地に制約があるか、クラウドへのアクセスが限られている組織にも適用できます。FastAPI/Next.jsスタックは一般的なものですが、レンダリングされたチャートや文章上の主張を基盤となるデータの根拠に結びつけるプロベナンス追跡レイヤーが、汎用的なAI分析ツールと比較したアーキテクチャ上の差別化要素となっています。

Source: https://github.com/wzn1118/AsteriaAnalyst