デイリーAIダイジェスト — 2026-09-02

公開

2026年9月2日

English · 日本語

arXiv ハイライト

SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers

問題

Looped Transformerは、パラメータを増やさずに実効的な深さを増すために共有レイヤーブロックを再利用するものであり、先行研究ではこのトリックによる性能向上が繰り返し報告されています。しかし、そのほとんどの比較はモデルサイズを固定しており、実効的な深さと同時にトークンあたりのFLOPsおよびKV cacheも増加してしまうため、アーキテクチャ上の利点と余分な計算量の恩恵が混在しています。本論文が答える問いは次のとおりです:トークンあたりのFLOPs、非embedding総パラメータ数、KV cacheを厳密に一致させた場合でも、loopingは依然として有効か——特に、sparsityによってパラメータと実際の計算量がすでに分離されているMoE Transformerにおいて。

手法

ベースラインは、GQA attentionとtop-8 expert routingを備えたdecoder-only sparse MoE Transformerであり、物理的な深さ L \in \{10, 12, 20, 30\} によって4つのactiveパラメータスケール(100M、200M、600M、1.6B)が定義されます。Looped variantは、m 層からなる連続したスパンを r 回繰り返します。ループ内で重みが共有されたresidualの更新が残差ストリームを発散させないよう、ループ内の各sublayerの更新は 1/r でスケーリングされます:

x \leftarrow x + \tfrac{1}{r}\,\text{Sublayer}(x).

設計のablation(すべて200Mスケール)では (m,r) を広範に探索し、SMELTレシピとして中間半分のレイヤーを2回loopするr=2、スパン = 中間の L/2 層)という設定に至りました。Budget matchingは、ペアとなるベースラインとSMELTが3つのbudget(トークンあたりのFLOPs、非embedding総パラメータ数、KV cache)すべてで一致するよう、ベースラインの幅・expert数・head数を調整することで実現されており、異なるのはloop構成のみです。

Scaling lawは、Chinchillaスタイルで各アーキテクチャ別に、4つのスケールと密度参照コントロール S=0\% および3つのMoE sparsity S\approx\{85\%, 95\%, 97\%\} からなる 4\times4 グリッドに対してfitされます。共通のWSD(warmup–stable–decay)スケジュールを使用しており、各セルの安定フェーズrunを6つのcosine-decayブランチに分岐させることで、scaling surfaceのfitに必要なデータ軸の変動を得ています。合計32のrunにより96組のベースライン/SMELTペアと192の評価エンドポイントが生成され、最大スケールでは非embedding総パラメータ数54Bに達します。

結果

Loss curves。 S\approx 97\% において、SMELTはstableフェーズ全体および6つのcosine-decayブランチのすべてにわたって、ベースラインを下回るlossを維持します。これは非embeddingパラメータ数22B(activeパラメータ600M)および54B(activeパラメータ1.6B)の両スケールで確認されています。トークン軸を累積学習FLOPsに置き換えた場合、SMELTは16のグリッドセルすべてでベースラインよりも低いvalidation lossを達成します。Chinchillaスタイルのsurfaceをfitすると、compute-optimalフロンティアにおいて6.8〜18.0%の学習FLOP削減が得られ、その値はsparsityとスケールに依存します。

Downstream transfer。 SMELTは、DCLM Completionでは96/96のペア、DCLM Coreでは83/96のペア、MMLUでは29/30のペア(偶然水準から少なくとも10ポイント以上のベースラインのみ対象、偶然水準近傍の比較はノイズが多いため)でそれぞれ優れた結果を示します。重要なことに、downstreamの性能向上はvalidation lossから予測されるものを上回っています。著者らは、96のベースラインエンドポイントを使用して、validation loss \ell から各ベンチマーク y へのfour-parameter sigmoid calibration \hat{y}_m(\ell) をfitしています:

\hat{y}_m(\ell) = b_m + \frac{a_m}{1+\exp[-d_m\,\alpha_m(\ell - \tau_m)]},

ここで d_m = +1 はcompletion lossに、d_m = -1 はaccuracyメトリクスに対応します。Fitは良好で:R^2 = 0.997(Completion)、0.974(Core)、0.911(MMLU)となっています。符号補正済み残差 \delta_i = s\cdot(y_i - \hat{y}(\ell_i)) を定義すると、SMELTのエンドポイントはすべてのスケールにおいて、calibrationの「ベースライン曲線より良い」側に系統的に位置します。この優位性はCodeで最も大きく、サンプル長とin-contextサンプル数の増加とともに拡大します。

Mechanistic probes。 同一トークンが同一の物理的MoEレイヤーを通過する1回目と2回目のvisit間のrouting overlapは |\text{top-8}_1 \cap \text{top-8}_2| \in \{0,\dots,8\} で測定されます。n 個の候補expertに対する独立ランダムroutingでは期待overlapが 8^2/n となります。密度参照 S=0\% では2回のvisitでほぼすべての8 expertが再利用されますが、S\approx 97\% ではoverlapはトークンあたり2〜3 expertに低下します——依然として偶然よりは十分高いものの、routerが残差ストリームの内容の更新に応じて2回目のパスで genuinely expert を再割り当てしていることを示しています。attention分析ではさらに、2回目のvisitがattention-sink mass(最初のいくつかのトークンへの病理的な集中)を低減し、内容に関連するトークンへリダイレクトすることが示されています。これが、著者らがvalidation lossの予測を超えるdownstreamの性能向上の原因として挙げるinductive biasです。

限界と未解決の問題

r=2 のみが大規模にスケールされており、より大きなloop count や非対称なスパン選択は54Bスケールではテストされていません。Scaling lawはアーキテクチャごとに別々にfitされており、外挿されたcompute節約の区間はパラメトリック形式に依存します。Codeに重点を置いた優位性とin-context長のscalingは実証されていますが、attention-sink低減との因果関係は示されておらず、mechanistic storyは相関的なものにとどまります。最後に、KV cacheとトークンあたりのFLOPsをマッチングすることは学習コストとprefillコストをマッチングしますが、中間半分を2回通過することでそのスパンを通るトークンのdecoding wall-clock latencyは依然2倍になります;推論時のトレードオフは直接的には定量化されていません。

なぜ重要か

loopingが厳密なFLOPs・パラメータ数・KV matchingのもとで比較された場合——実際に実務者が関心を持つ設定——では、シンプルなレシピ(中間半分を2回loop)でも非embedding総パラメータ数54Bまでにわたって、compute-optimal MoEのscalingフロンティアを6.8〜18.0%改善し、validation lossから予測されるものを超えるdownstreamの性能向上をもたらします。これにより、重みが共有された深さは小規模モデルへの curiosity にとどまらず、frontier MoE学習における生きたアーキテクチャ上の軸となります。

Source: https://arxiv.org/abs/2609.01343

StudentSim: LLMベースの学習者シミュレータの訓練

問題設定

AIチュータリング研究では、実際の学習者からデータを収集するのに数ヶ月を要することなく、どの指導戦略がどの学習者に有効かを評価する手段が必要です。既存の2つのアプローチは、それぞれ逆の方向で不十分です。ベイズ/IRT型の状態追跡モデルは学習者の応答分布をある程度うまく適合させますが、自然言語によるチューターの説明や訂正を取り込む機能を持たず、テキストに基づいて状態を更新するメカニズムがありません。一方、LLMのロールプレイは逆の特性を示します。すなわち、指導内容を流暢に読んで応答できますが、模倣対象の学習者が持つ特定の能力プロファイルとは一致しません(「初心者を演じてください」と指示されたGPT-4クラスのモデルは、特定の学習者の誤答分布ではなく、一般的な弱いプレイヤーの傾向に偏ります)。StudentSimは、訓練パイプラインによって、行動的忠実性(ホールドアウトした問題において学習者の記録済み応答と一致する)と指導応答性(チューターのテキストを読んだ後に標準的な訂正済み応答へとシフトする)の両方を備えた、学習者ごとのシミュレータを生成できるかどうかを問います。

形式化

各実際の学習者 \pi_ii=1,\dots,N)について、本論文は2種類の記録を保持します。シングルターン記録 S_i = \{(x,m)\} は問題と学習者の実際の応答を対にしています。マルチターン記録 T_i = \{(x,m,\tau,m^*)\} はさらに、誤答 m に対処するチューターの指導 \tau と、標準的な訂正済み応答 m^*(チェスにおけるエンジン推奨手、第二言語ライティングにおける訂正済み断片、数学における正解選択肢)を含みます。行動的忠実性 \mathcal{F}_iM_iS_i に対してスコアリングし、ドメインごとにインスタンス化されます:チェスにおける手予測精度、第二言語における誤答プロファイル一致度(全体的な誤答率と問題タイプの分布)、数学における選択肢一致精度です。指導応答性 \mathcal{R}_i は、\tau が挿入された後に T_i 上での M_i の応答が m^* へとシフトする頻度を測定します。集団スコアは平均として表されます:\mathcal{F} = \tfrac{1}{N}\sum_i \mathcal{F}_i

2段階訓練

ユーザーごとのデータ希少性は深刻であり、第二言語学習者の中央値では3つのエッセイしか提供せず、3分の2以上が5つ以下しか提供しません。学習者ごとにLLMをエンドツーエンドで fitting するとオーバーフィットし、共有構造を毎回再学習することになります。そこでStudentSimは以下を採用します:

Stage 1(プール化)。 全Stage-1学習者の S_i \cup T_i の和集合上で、単一のドメインベースシミュレータを訓練し、共有された誤答パターン、応答フォーマット、および指導→修正済み応答のマッピングを学習します。マルチターン記録は各バッチで 0.20 の比率でサンプリングされ(シングルターンは 0.80)、指導への追従がベースライン行動と並行して学習されます。

Stage 2(特化)。 Stage-1のベースを、少量の学習者ごとの S_i \cup T_i に対してfine-tuningし、M_i を生成します。プール化されたバックボーンがすでに共有構造を保持しているため、学習者ごとの適応は、ベースを1人の学習者の個癖へシフトさせるだけでよく、それは少数のエッセイや1000手程度の棋譜で十分に支えられます。

評価とデータ規模

StudentSimEvalは、30人のチェスプレイヤー(Lichess、2025年5月)、15人の第二言語学習者(EFCAMDAT、Geertzen et al. 2013)、15人の数学学習者(Worden et al. 2026 foundational-assistance corpus)からなる評価セットを固定しています。Stage-1のスケール(学習者数/プール化訓練インスタンス数):チェス 100/100,000;第二言語 200/7,800;数学 200/23,400。Stage-2の学習者ごとのスケール:チェス 1,000;第二言語 73;数学 153 訓練インスタンス。ホールドアウトされた学習者ごとのセットは S/T = チェス 5,000/4,000;第二言語 26/40;数学 66/59(平均、範囲21〜99)。第二言語のマルチターンコーパスは実際の教師によるアノテーションによるものであり、チェスと数学については固定されたスタイルテンプレートのもとでLLMが生成したものです。LLMは文言を制御しますが、目標応答 m^* はStockfishまたは監査済みの解答キーによって固定されており、指導スタイルと正解ターゲットが分離されています。

シミュレータフィードバックを用いたチューターRL

本論文はチェスにおける概念実証として締めくくられており、プール化されたStage-1 StudentSimをRL報酬源として使用しています。各エピソードでは、位置 Q 上の実際の悪手 A_{\text{prev}} を再現し、チューターポリシーが指導を提案し、frozen状態のシミュレータが修正後の手 A_{\text{rev}} を出力し、報酬は A_{\text{rev}}A_{\text{prev}} に対するStockfish centipawn改善量となります。最適化にはGRPO(Shao et al. 2024)を使用し、盤面を画像としてテキストと共に読み込むQwen3-VL-8Bチューターに適用されます。3つの条件はSFT initとチューターポリシーを共有し、報酬のみが異なります:RL無しのSFTベースライン、GPT-5.4-as-studentシミュレータ、そして2つの乗法的ゲートを持つStudentSim(意図された指導スタイルへの準拠をスコアリングするpersonalization headと、盤面を誤って説明する解説にペナルティを与えるperception head)です。中心的な主張は「最良のチューター」ではなく、忠実で応答性があり、ローカルで稼働するシミュレータが、frontier APIシミュレータよりも実行可能かつ低コストな報酬源であるということであり、専門家による人間評価(Appendix E.5)によって評価されます。Stockfishはシミュレータから独立した外部検証シグナルを提供しており、これがチェスを選択した理由です。第二言語や数学への転移はドメインごとの自由形式の報酬関数を必要とし、スコープ外として明示されています。

限界と未解決の問題

本論文は(提供されたセクションでは)この場で集約された \mathcal{F}\mathcal{R} の数値を示しておらず、チューターRLの結果は本文中の抜粋でeffect sizeが引用されていない人間評価に依拠しています。プール化によるデータ希少性の緩和は、一貫した共有集団を前提としており、異質な学習者コホート(例:非常に多様な第二言語背景)はクラスタ化または階層的なStage-1を必要とする可能性があります。第二言語の忠実性メトリクスは周辺分布とプロファイルの一致であり、系列レベルの結合一致ではないため、シミュレータが誤答率の統計には一致しながら不自然なエッセイを生成してしまう可能性があります。マルチターン比率 0.20 は学習者ごとにチューニングされるのではなく固定されており、数学では学習者ごとの T 数が21〜99の範囲にあるため、カウント数の少ない学習者では \mathcal{R}_i がノイジーになります。RL報酬ヘッドは手動設計されたゲートであり、手の品質項との合成やトレードオフの有無については抜粋内で分析されていません。

なぜこれが重要か

適応的チュータリングの報酬モデルはボトルネックであり続けてきました:実際の学習者データの収集には時間がかかり、frontier APIのロールアウトはコストが高く、クローズドです。行動的に忠実でかつ自然言語の指導のもとで適切に更新される、小規模でオープンな学習者ごとのシミュレータは、チューター最適化をローカル報酬を用いた標準的なRLループへと変換し、これまで大部分で欠如していたベンチマーク(StudentSimEval)をこの研究分野に提供します。

Source: https://arxiv.org/abs/2609.01591

ZimaBlue: スケーラブルなVideo Pre-trainingによる汎化可能なWorld Action Modelsの発展

問題

ロボット操作ポリシーの汎化性能は低く、その主な原因はアクションラベル付き軌跡が希少かつ偏っている一方、一人称視点動画は豊富に存在するもののアクション情報を含まない点にあります。受動的な動画を制御に関連した事前分布に変換しつつ、アクション分布を単一の身体系に収縮させないようにする方法が問われています。ZimaBlueは、動画教師信号とアクション教師信号を切り離す3段階カリキュラムを提案し、身体系をまたぐ統一100次元セマンティック状態・アクションインターフェースを使用し、大規模な動画生成world modelがリアルタイムのクローズドループ制御を駆動できるようSlow-Fastデュアルシステムアーキテクチャを採用しています。

統一状態・アクションインターフェース

ロボットデータセットは不均質な制御API(デカルト座標エンドエフェクタ、関節空間、バイマニュアル、移動ベース、多指ハンド)を持ちます。ZimaBlueはこれらすべてを、状態とアクションで共有する固定100次元スロットベクトルにマッピングします。各エンドエフェクタは9次元(3D並進+連続6D回転)を占有し、追加スロットとしてグリッパー(1+1)、腕関節(7+7)、胴体(4)、移動ベースおよび補助チャンネル(16)、23次元多指ハンド×2が割り当てられます。非使用スロットはゼロ埋めされマスクされます。たとえばDROIDでは100座標のうち17座標を有効化します(左エンドエフェクタ姿勢9+グリッパー1+左腕関節7)。これによりスロットごとの物理的意味論が保持され、データセットごとのアクショントークナイザなしに、DROID・バイマニュアルプラットフォーム・ヒューマノイドデータにわたって単一のheadを学習することができます。

3段階カリキュラム

データピラミッド:video pretraining、video-action mid-training、身体系固有post-training。

ベースは事前学習済みのtext-to-video diffusion transformerです。

  • Stage I — Causal embodied video pretraining。 Slow DiTは大規模で不均質な一人称視点の人間・ロボット動画を用いて、視覚的latentのみにflow-matching objectiveを適用して学習されます。これにより、アクションを必要とせず、生成的事前分布が制約のないインターネット動画から因果的・身体的な順方向ダイナミクス(接触、道具使用、長期ホライズン)へと適応されます。
  • Stage II — Video-action mid-training。 同期された観測、固有感覚的状態、言語、アクションを持つロボット軌跡が導入されます。同じflow-matching objectiveが統一100次元空間内のアクションチャンクにも拡張されます。ここでのアクション予測は最終的な成果物ではなく、補助的なアライメント信号です:これにより、Slowモデルの視覚的特徴が、身体系をまたぐ共有アクションインターフェースのもとでモーター関連情報を保持するよう強制されます。
  • Stage III — Post-training。 軽量なFastブランチが導入され、デプロイ先の身体系に特化されます。Stage I〜IIではSlowのみを最適化することで、動画中心のworld modelに計算資源を集中させます。Stage IIIまでにSlowの特徴はすでにアクションに根付いているため、実行可能な低レイテンシアクションへのマッピングははるかに小さな学習問題となります。

一貫して単一のflow-matching objectiveが使用されます——Stage Iでは視覚的latentに、Stage IIでは視覚的latentとアクションチャンクに同時に、Stage IIIではFastブランチのアクションに適用されます。

Slow-Fastデュアルシステム

Slow DiTは将来の動画トークンとアクショントークンを同時にデノイズし、FastDiTは更新された観測・状態とSlowのK/Vキャッシュを受け取ってアクションチャンクを出力する。

Slow DiTは観測、固有感覚的状態、言語、ノイズ付き動画・アクショントークンを入力として受け取り、将来の視覚的latentとアクションを同時にデノイズします。デプロイ時、Slowが予測したアクションは学習時のアライメントにのみ使用されます。実行はFast DiTから行われ、現在の観測と状態を入力とし、Slowブランチのキャッシュを条件付けにして高頻度でアクションチャンクを生成します。

非同期推論:Slowは低頻度でK/Vキャッシュを更新し、Fastは最新の観測と場合によっては古いSlowガイダンスを受け取り継続的にアクションを出力する。

推論は非同期です。Slowは低レートで動作して将来動画のK/Vキャッシュを発行し、Fastは高レートで動作し、「古い」Slowキャッシュを許容しながらアクションを継続的に実行して新鮮な観測を提供します。次にDistribution Matching Distillation(DMD)が両ブランチに順次適用され、各ブランチのDiT関数評価回数を8回から2回に削減します。torch.compileと組み合わせることで、通常のdiffusion policyでは到達できないリアルタイム動作域に生成的WAMを収めることができます。

結果

ゼロショット実機ロボット評価では、DROIDでpost-trainingされた7自由度Frankaを使用し、StandardとPerturbedの2種類のプロトコルに分けられた12個のheld-outタスクで評価します。外部RGBカメラ2台、手首カメラ、固有感覚情報、および言語命令を入力として使用します。本論文は、(i)一人称視点動画pre-trainingと(ii)マルチ身体系video-action mid-trainingをそれぞれのステージを省いた変種と比較するアブレーションの実証的根拠として、これらのタスクを報告しています。ここで示されたセクションではタスクごとの成功率は列挙されていませんが、評価はタスク固有のデモンストレーションなしに、held-outタスク・シーン構成においてカリキュラム各ステージの寄与を分離するよう明示的に設計されています。

限界とオープンクエスチョン

設計から複数の課題が見受けられます。第一に、100次元スロットレイアウトは手動設計であり非対称です——100次元のうち46次元が多指ハンドに割り当てられており、身体系間の転移は学習済みアクションコードブックではなく共有スロット意味論に依存しています。第二に、Stage IIにおけるアクション教師信号は補助的なものであり、Slowブランチのアクションheadがフォールバックコントローラとして実際に十分に較正されているかどうかは不明です。第三に、非同期のSlowガイダンスは陳腐化を招きますが、本論文は「古い」キャッシュの存在を認めながらも(示されたセクションでは)Slow更新頻度に対する性能劣化曲線を定量化していません。第四に、8ステップから2ステップへのDMDは通常動画生成の精度をある程度犠牲にしますが、これがFastブランチのSlowキャッシュ品質への依存とどのように相互作用するかは報告されていません。最後に、評価プラットフォームは単一の7自由度アームであり、統一インターフェースによる身体系間汎化の主張は、引用されたセクションではバイマニュアルまたは多指ハードウェアで直接検証されていません。

この研究の意義

ZimaBlueは、(a)カリキュラムステージをまたいで動画教師信号とアクション教師信号を分離し、(b)生成コストを非同期Slowブランチにオフロードしながら蒸留されたFastブランチがループを閉じることで、video diffusion transformerをリアルタイムロボットコントローラに変換するための具体的なレシピです。アブレーションが成立するならば、スケーラブルな操作ポリシーはアクションラベル付き軌跡からのエンドツーエンド学習ではなく、動画world modelsの上に構築すべきであることを論じています。

Source: https://arxiv.org/abs/2609.00188

本番トラフィックからPost-Trainingへ:企業のリクエスト混合に対応するセルフホスト型LLMの構築

問題設定

データレジデンシー要件により、企業はLLMをセルフホストせざるを得ない状況にあります。また、古いモデルを廃止せずに四半期ごとに新モデルを追加し続けるという誘惑が、有限のGPUプールを半稼働状態のデプロイメントが乱立するカオスな環境へと変えてしまいます。著者らは特定の統合問題を対象としています。すなわち、200以上の社内アプリケーション固有のモデルインスタンスを、レイテンシ・コスト予算を満たすためにnon-reasoningモードに限定しつつ、混合フリート全体の品質に匹敵または超える単一のセルフホストチェックポイントで置き換えることです。ベースモデルはキリル文字特化の再トークナイズを施したQwen3-32Bであり、目標は社内Arenaにおいて約7\times大きいベースラインを置き換えることです。

本番環境のエラー分析から、品質に関する3つの軸が浮かび上がります。instruction following(IF)、function calling(FC)、そして社内タスク分布へのalignmentです。本論文の中心的な主張は、これらの軸を同時に最適化するとクロスドメインの報酬干渉——semantic collapse、over-calling、verbosity hacking——が生じるというものであり、fork-and-mergeレシピがjoint trainingを明確に上回るという点にあります。

本番トラフィックからの社内Arenaの構築

評価問題はtraining以前の段階にあります。社内トラフィック(月間約100kクエリ)は、少数のpromptテンプレートが可変スロットに値を代入して生成されるテンプレート化されたリクエストに支配されています。単純に「多様性」を追求する手法(greedy max-min、#InsTag)は、ほぼ重複するテンプレートを別々のクラスタに水増しし、サービス分布を歪めてしまいます。

著者らのtemplate-awareサンプラーは、可変トークンをマスクし、正規化されたpromptをLSHでグループ化し、可変スパン上のgreedy max-minによってテンプレート内の代表事例を選択し、\sqrt{\text{count}}に比例してバジェットを割り当てます。多様性を平均ペアワイズTF-IDFコサイン距離で、代表性をモデル・長さ・サービス・分類軸に沿った本番プールとのJensen–Shannonダイバージェンスで測定すると、この手法は多様性0.953を達成し、greedy max-minの0.944、#InsTagの0.874を上回ります。一方、\text{JS}_{\text{svc}} = 0.281を維持し、greedy max-minの0.683より大幅に低い値を示します。ランダムサンプリングはJSが最小ですが、多様性は0.653に過ぎません。このサンプラーのみがParetoフロンティア上に位置します。

Trainingレシピ:SFT-then-fork-then-SLERP

Stage 1は、社内データ・汎用データ・IF・FCデータを混合した単一の統合SFTです。アブレーション実験(論文のTable 3)により、ドメインごとのSFTエキスパートは統合混合に比べて何ら優位性をもたらさないことが示されており、SFTはモノリシックな構成のまま維持されます。

Stage 2では、SFTチェックポイントを3つのGRPOエキスパートにフォークし、それぞれドメイン固有の報酬に対して収束まで学習させます。

  • Generalエキスパート。 ロシア語オープンソース命令データ80%+社内サンプル20%(template-awareサンプラーで抽出し、Min-Hashで汚染除去)を使用し、ターゲット分布の均質性を確保するためにすべての補完をQwen3-235B-A22B-Instruct-2507で再生成します。このコーパスで別途訓練したreward modelがGRPOロールアウトを採点します。2つの重要な安定化手法として、教師モデルから得られたpromptごとの長さベースラインに基づく乗法的長さペナルティと、ドリフトを制約するための大きめのKL係数を採用しています。

図1

図1は、この手法がブロックしようとしている失敗モードを示しています。長さ+KL正則化なしでは、平均RM報酬が上昇する一方、応答長さが単調に増加していく——長さバイアスのかかったRMに対するclassicなverbosity hackingです。正則化あり(図2)では、報酬は依然として増加しますが、長さは有界に保たれます。

図2
  • IFエキスパート。 決定論的な検証器報酬によるGRPO(ここでの失敗モードはsemantic collapse——モデルが構造的制約を満たしながらコンテンツ品質を低下させること)。
  • FCエキスパート。 図3のパイプラインから生成された合成対話で訓練されます。プランナーがサンプリングされたツールグループから構造化されたトラジェクトリを組み立て、最大4回のジャッジフィードバックラウンドを経てそれを精緻化し、次に非対称な可視性を持つ3エージェントのステップワイズシミュレーション(User、Assistant、Tool)がトラジェクトリを実行します。エラーと判定されたアシスタントのターンはコンテキストに残りますが、ターゲットとしてラベル付けされることはありません。ここでブロックされる失敗モードは、浅い成功ヒューリスティクスによって報酬を得る不必要なツール呼び出しであるover-callingです。

図3

Stage 3では、3つのエキスパートを2段階の逐次SLERP(Shoemake 1985;Goddard et al. 2024)でマージします。SLERPはパラメータ空間の単位超球面上の測地線に沿って補間します。

\text{SLERP}(\theta_A, \theta_B; t) = \frac{\sin((1-t)\Omega)}{\sin\Omega}\theta_A + \frac{\sin(t\Omega)}{\sin\Omega}\theta_B,

ここで\Omega = \arccos(\hat\theta_A \cdot \hat\theta_B)です。逐次的に行う方法(単一の3方向重心平均ではなく)は軸ごとの性能向上を保持しますが、あるマージ順序が他より優れる理由については論文中で十分に説明されていません。

結果

non-reasoningモードにおいて、マージされた32Bモデルは約7\times大きいベースラインを以下の点で上回ります。

  • 社内Arena:69.6 vs 65.8
  • ruIFEval(loose):0.85 vs 0.83
  • BFCLv3(function calling):0.79 vs 0.77

汎用対話ベンチマーク(Arena Hard Ru、WildChat Hard Ru)も改善されています。運用面では、単一のデプロイメントがプラットフォームトラフィックの50%を吸収します(アブストラクトは正確な記述が省略されていますが、これが統合の主要な数値です)。

汚染除去は意図的に行われています。ベンチマーク項目はgeneralエキスパートの社内インクリメントから除外されており、IF/FCエキスパートは合成データのみで訓練されるため、性能向上は本番トラフィックと構造を共有する評価テンプレートの記憶によるものとは言えません。

限界と未解決の問題

  • このレシピはnon-reasoningモードに限定されており、干渉の議論がlong-CoTの領域にも適用できるかどうかは未検証です。
  • SLERPのマージ順序は経験的に扱われており、どの軸を最初に補間すべきか、あるいは測地線の仮定が非ガウス分布のエキスパートデルタとどのように相互作用するかについての原則的な説明はありません。
  • generalの軸には検証可能な報酬がなく、社内適応版がgeneralなものを上回らなかったRMに依存しています——著者らはalignmentをデータキュレーションに委ねており、これによりgeneralエキスパートが本番alignmentを高められる余地は制限されます。
  • 報告された性能向上はロシア語適応ベンチマークに基づくものであり、英語の付録の数値はここでは要約していません。

この研究の意義

これは、本番トラフィック自体をtraining・評価分布として扱い、IF/FC/general軸にわたる報酬干渉がjoint RLよりもfork-train-mergeを正当化するほど深刻であるという具体的な証拠を提示する、数少ない公開済みpost-trainingパイプラインの一つです。template-awareサンプラーと、verbosity/over-calling/semantic-collapseの分類体系は、社内LLMフリートを統合しようとするすべての人にとって直接再利用可能なものです。

Source: https://arxiv.org/abs/2609.01572

ネイティブ統合マルチモーダルモデルにおける理解・生成シナジーの解明:表現・タスク・システムの観点から

統合マルチモーダルモデル(UMM)は視覚的理解と画像生成を1つのネットワークに統合しますが、機能の共存は学習上のシナジーを意味するわけではありません。本論文では、事前学習済みの視覚エンコーダを導入しないネイティブな設定において、表現・タスク・システムの3つのレベルで相互作用を詳細に分析します。これにより、観察されるシナジーが継承されたpriorではなく、joint trainingによるものであることを明確にできます。提案された定式化は、マルチモーダルコンテキストに対するcausal autoregressive modelingと、生成画像内の視覚トークンに対するbidirectional flow matchingを組み合わせたもの、すなわち現在主流のハイブリッドAR + flowレシピ(Zhou et al. 2025; Deng et al. 2025)です。

3レベル研究の概要

表現レベル:干渉と特化

著者らは、SenseNova-U1の混合データを用いて、学習率1\times 10^{-4}一定で210kステップのスクラッチ学習を行い、その後フリーズした特徴量をprobeします。両目標は互いに有用なシグナルを提供しており、生成は理解に利用される視覚特徴を強化し、理解は生成のための視覚・言語アライメントを改善します。しかし、2つの目標が同一の計算パスを通じて処理される場合、一方が他方を支配して性能を低下させます。conflictingする視覚計算を特化しながら意味的相互作用を共有するtask-decoupledなMixture-of-Transformers(MoT)は、この非対称的な崩壊を回避します。

理解のみの学習とjoint trainingにおける密な視覚特徴のPCA比較

パッチレベル特徴の共有3D基底へのPCA射影によってその効果が可視化されます。joint trainingは理解のみの学習と比較して、より一貫したオブジェクト領域とより明確な空間構造を生成しており、フリーズした線形probeによる測定結果とも一致しています。重要なアーキテクチャ上の知見は、パラメータ共有それ自体がシナジーの源ではなく、ルーティングのトポロジーが2つの目標が協調するか上書きし合うかを決定するという点です。

タスクレベル:共有知識を介した双方向転移

タスクレベルの実験では、ベースモデルと汎用データ(各混合の50%)を固定し、タスク固有の理解・生成データを交換します。注目すべきケースは幾何学的問題解決であり、図形は解析される場合と描画される場合で同じ関係構造を持ちます。

3つのレジームを比較します:理解のみ(Und)、幾何学的生成・編集データを生成ターゲットとして補強したUnd(Und+Gen)、および同じ生成例を画像説明・変換説明タスクに変換した管理されたTextual-Descベースライン(ソースデータは同一で、学習シグナルのみ異なる)です。

Training Geometry3K PGPS9K MathVerse MathVista
Und 59.90 72.40 60.13 71.80
Und + Textual-Desc 63.56 73.90 59.11 73.60
Und + Gen 65.39 73.40 63.15 74.30

Und+GenはUndと比較してGeometry3Kで+5.5ポイント、MathVerseで+3.0ポイント改善し、幾何学以外の数学(MathVista +2.5)にも転移します。重要なのは、同じデータを使用するTextual-DescがGeometry3Kで劣っており(63.56 vs. 65.39)、MathVerseではUndより悪い結果(59.11 vs. 60.13)であるという点です。つまり、利益は単に「幾何学トークンの増加」ではなく、図形を生成すること(幾何学的構造に制約されたピクセル空間の監視)がテキストで説明するよりも強力な補助シグナルになっているということです。

SVGプログラムからのコード条件付きVQAと1ステップでデコードされた画像

SVGのケースがこれを強化しています。joint training後、モデルはコード条件付きVQAにより正確に回答し(すなわち、画像を見ることなくSVGのレンダリングされた外観を推論できる)、1ステップのflow matching予測がすでに正しいグローバルな形状とレイアウトを示しています。生成はレンダリング整合的なグラウンディング目標として機能し、理解を正則化しています。

システムレベル:エンドツーエンドUMM vs. プランナー・エグゼキューター

最終的な問いは、統合が本質的に理解と生成を連鎖させるタスクに役立つのか、あるいは2つの専門家のモジュラーなパイプラインで十分なのかというものです。同一のtask-decoupled MoTチェックポイントを、同じ推論集約型編集データで3通りにfine-tuningした設定を注意深くマッチングしています。(1) エンドツーエンド(暗黙的な指示→明示的な編集+ターゲット画像)、(2) プランナーのみ(暗黙的→明示的な指示)、(3) エグゼキューターのみ(ソース+明示的な指示→ターゲット)です。推論時、(2)+(3)はエージェンティックなパイプライン、(1)はUMMです。

System RISEBench Overall KRIS-Bench Overall
Planner → Executor 16.66 66.48
End-to-end UMM 18.88 68.33

エンドツーエンドモデルはLogical(9.41 vs. 11.76)を除くRISEBenchの全カテゴリでパイプラインを上回り、Temporal(22.35 vs. 18.82)とCausal(27.77 vs. 22.22)編集で最大の改善を示します。KRIS-Benchでは小さいながらも一貫した+1.85の全体的改善が見られます。ベースの重み、データ、計算量が一致しているため、この差はエグゼキューターが離散化されたテキスト指示ではなくプランナーの内部的な推論状態に直接アクセスできることに起因しています。これはまさに情報ボトルネックがモジュラーシステムを損なう箇所です。

制限と未解決の問題

本研究はAR-text + flow-matching-imageの定式化に限定されており、完全にautoregressive tokenizedなパイプラインや離散的なdenoisingのUMM(例:LLaDA方式)への結論の転移可能性は明示的に未解決のまま残されています。表現レベルのprobingは機械論的な介入ではなく、フリーズした特徴のPCA可視化と線形probeに依存しているため、「どの計算がconflictするか」という主張はアーキテクチャ上の経験的なものであり、因果的ではありません。タスクレベルの研究は3つのケースをカバーしており(幾何学は本稿で詳述された1つです)、理解タスクと生成タスクの間の共有知識がいつ正の転移をもたらすほど十分に強いのか、また生成目標がいつ分散になるのかは、まだ明確ではありません。システムの面では、RISEBenchのLogical編集がエンドツーエンド学習下で後退しており、統合モデルが専用テキストプランナーが保持する明示的な記号的計画を犠牲にしている可能性を示唆しています。

なぜ重要か

本論文は、UMM設計をテスト可能な問い——joint trainingは実際にシナジーを生み出すのか、またそれはどこで生まれるのか——に基づいて再構築し、具体的なアーキテクチャ上(task-decoupled MoT)、データ上(補助的な生成監視はテキスト説明よりも優れる)、システム上(エンドツーエンドは密結合な推論・編集タスクでプランナー・エグゼキューターを上回る)の処方箋を提示します。ネイティブUMMを構築する研究者にとって、統合の正しい単位はすべての計算パスの共有重みではなく、意味的相互作用であると主張しています。

Source: https://arxiv.org/abs/2609.01607

DiagEvo: 階層的エラーメモリによる診断ガイド付き自己進化

問題

チャレンジャー(問題生成器)とソルバーを交互に動作させる自己対話型 LM 学習ループは、数ラウンド後に頭打ちになるか、性能が後退する傾向があります。困難度・学習可能性・多様性といった、方向性のない目標設定では、問題をハードかつ多様に保つことはできても、次にどの推論上の弱点を攻めるべきかは示されません。典型的な失敗パターンは「表面的な膨張」です。すなわち、チャレンジャーがプロンプトの長さや構文上の複雑さを増大させるだけで、新たな推論上のギャップを露わにしないため、ソルバーのホールドアウト精度は停滞する一方で問題の長さだけが増大していきます。

自由探索と DiagEvo における共進化の比較

もう一方のアプローチである「ガイド付き自己対話」は、人間が用意したシード・コーパス・目標難度から方向性を取り込みますが、これにより閉ループが破られます。DiagEvo が主張するのは、その方向性はソルバー自身の失敗軌跡から内生的に抽出できるということです。具体的には、繰り返し発生するエラー原因の永続的かつ階層的なメモリを保持する診断モデルを用います。

手法

DiagEvo の1ラウンドは、原因条件付き生成・ダブル信頼度フィルタリング・失敗軌跡からのメモリ管理・原因状態による次ラウンドのスケジューリング、という4つのステージで構成されます。

DiagEvo の1ラウンド:チャレンジャー・フィルター・診断モデル・メモリ

階層的エラーメモリ。 ソルバーの失敗軌跡は診断LM(実験では Qwen3-Instruct の4B/30B/235B 変種)に渡されます。診断LMは自然言語でエラー原因を抽出し、既存のエントリと重複排除を行い、各原因を2段階ツリーのスキルノードに割り当てます。各原因は \{\text{Active}, \text{Mastered}\} の状態と再発カウンターを保持します。習熟度はターゲットを絞ったプローブ問題におけるソルバーの self-consistency で判定され、昇格するとカウンターがリセットされます。

頻度駆動型スケジューリング。 \mathcal{M}_t をラウンド t 後に確定したメモリ、\mathcal{E}_t をその Active な原因、f_t(e) を原因 e の現在のアクティブエピソードにおける失敗回数とします。アクティブエピソードは原因がアクティブ化されたときに開始し、昇格時に終了します(このとき f_t(e) \leftarrow 0)。集約失敗圧力は F_t = \sum_{e \in \mathcal{E}_t} f_t(e) です。ラウンド1は自由探索のみを使用し、基準値 F_1 を定義します。以降は z_t = F_t / F_1 とします。

次のラウンドの自由探索確率 \varepsilon_{t+1} および目標原因の分布 p_{t+1}(e)

\varepsilon_{t+1} = \frac{F_1}{F_1 + F_t / k}, \qquad p_{t+1}(e) = \frac{f_t(e)}{F_t}

で与えられます。つまり、原因ターゲット型生成と自由生成の対数オッズは z_t に対して線形に増大し、k がクロスオーバーを決定します。すなわち、z_t = k のとき両モードは等確率になります。原因のサンプリングはエピソード頻度に比例するため、繰り返し発火し続ける原因に向けて労力が集中します。F_t = 0(すべての Active な原因が静止した場合)のとき \varepsilon_{t+1} = 1 となり、チャレンジャーは制約なしの探索に戻ります。ある原因の昇格には2つの効果があります。f_t(e) をゼロに下げ、再アクティブ化がなければ F_t を縮小させ、確率質量を徐々に探索に戻すという効果です。

完全な生成分布は次の混合分布で表されます。 q_{t+1}(x \mid \mathcal{M}_t) = \varepsilon_{t+1}\, q^{\mathrm{free}}_\theta(x) + (1-\varepsilon_{t+1}) \sum_{e \in \mathcal{E}_t} p_{t+1}(e)\, q^{\mathrm{tar}}_\theta(x \mid e, \mathcal{M}_t), ここで q^{\mathrm{tar}} は自然言語の原因とそのスキルノードのコンテキストを条件とします。チャレンジャーは GRPO で学習され、ソルバーは新たに生成された問題と擬似ラベルのペアのみを受け取ります。

ダブル信頼度フィルタリング。 ソルバーの学習データを構築するため、ソルバーの最頻出擬似ラベルが中間的な頻度帯に達した問題のみを保持します。これにより、自明な問題(ラベル一致が高すぎる)と解不能な問題(支配的な回答が存在しない)の両方をフィルタリングします。これにより、外部の監督なしに制御された難度の自己ラベル付きカリキュラムが得られます。

交互更新。 ラウンド内では、{チャレンジャー、ソルバー} のいずれか一方を凍結し、もう一方を更新します。チャレンジャーのみが \mathcal{M}_t にアクセスでき、ソルバーはサンプルと擬似ラベルのみを参照します。ソルバーの失敗が診断モデルにフィードバックされ、ループが閉じます。

結果と分析

実験は3つのベースソルバー(Qwen3-4B-Base、Qwen3-8B-Base、OctoThinker-8B-Hybrid-Base)と3つの診断モデルスケール(Qwen3-4B-Instruct-2507、Qwen3-30B-A3B-Instruct-2507、Qwen3-235B-A22B-Instruct-2507)で実施されました。図1の導入部の比較では、ガイドなし自己対話の定性的な失敗が示されています。問題の長さはラウンドをまたいで上昇する一方、ソルバーの数学平均は平坦化します。DiagEvo は問題の長さをほぼ一定に保ちながら数学平均を改善し続けており、その向上が表面的な複雑さではなく未解決の推論上の弱点を狙い打ちにすることで得られていることを示しています。図1(b) の問題例はこれを具体的に示しており、自由探索では語句や無関係な構造が膨張するのに対し、原因条件付き生成ではメモリで追跡された特定のスキルを問う問題が生成されます。

提供された抜粋には完全な結果の表が含まれていないため、図1の定性的な曲線以上にベンチマーク間の正確な差異を引用することはできません。

限界と未解決の問題

  • スケジューラーは固定の正規化子として F_1 に依存しており、最初のラウンドの探索が代表的でない場合(例えば、易しすぎる場合)、原因ターゲティングのスケジュール全体が誤較正されます。
  • 習熟度は self-consistency で判定されますが、これは「自信を持って間違えている」停滞と真の習熟度を混同します。
  • 診断モデル自体が LM であるため、エラー原因抽出における系統的なバイアス(例えば、異なる失敗モードを1つのノードにまとめるなど)がカリキュラムの形成に直接影響します。
  • ダブル信頼度フィルタリングは支配的な擬似ラベルを持たない問題、すなわちまさに最難関のケースを棄却するため、この手法はフロンティア難度での学習が不足する可能性があります。
  • スキルノードの粒度とハイパーパラメータ k は影響力が大きいと考えられますが、示された資料ではその感度は定量化されていません。

なぜ重要か

DiagEvo は、自己対話型強化学習の文脈で非公式に存在していたアイデアを具体的に実装しています。そのアイデアとは、ソルバー自身のエラー分布がカリキュラムの方向性を決める十分統計量であるというものです。失敗の履歴を明示的・構造化・型付きにし、シンプルなオッズ方程式を用いてそこから生成をスケジューリングすることで、コーパスや人間のシードに依存したガイド付き自己対話に代わる閉ループの代替手段を提供します。そして、ターゲット絞り込みドリルと探索をトレードオフするクリーンなノブ(k)を備えています。

Source: https://arxiv.org/abs/2609.00768

EM^2Mem: 大規模言語モデルのためのイベント中心マルチモーダルメモリ

問題

LLMを用いた長尺動画QAは、一般的にマルチモーダルメモリ(キャプションストア、フレームインデックス、ASR転写テキスト、セグメントごとの要約、知識グラフなど)に依存しています。これらのストアからの検索は、モダリティ固有のフラグメントを返し、LLMは推論時にそれらを再整合させなければなりません。これはクロスモーダルバインディング問題をコンテキストウィンドウに押し込む形になりますが、そこではトークン予算が逼迫しており、ソース間のアトリビューションも脆弱です。その結果、質問が数分または数日分の動画にまたがる場合に、冗長なトークン、弱いグラウンディング、不一貫な時間的推論が生じます。

EM^2Memは、整合は読み取り時ではなく書き込み時に行うべきであると主張しています。フラグメントをモダリティでインデックスするのではなく、イベントでインデックスし、各イベントアンカーに異種の証拠を結び付けます。

EM^2Memはマルチモーダルな証拠をイベント中心のメモリセルに組織化し、孤立したフラグメントではなくイベントに対するグラウンドされた検索を可能にします。

手法

パイプラインは「整合してから検索する」という設計です。長尺動画 V は短い時間的イベントのシーケンス \{e_i\} にパースされ、これが共有インデックスとして機能します。各イベント e_i に対して、システムはメモリセル

M_i = (R_i, \mathcal{C}_i, \pi_i)

を構築します。ここで R_i はローカルマルチモーダルレコード(視覚スニペット特徴量、キャプション、転写テキストスパン、検出されたエンティティ・オブジェクト、意味的ファクト)、\mathcal{C}_i はマルチスケールコンテキストビュー(複数の時間解像度における近傍イベント)、\pi_i はアトリビューションに使用されるプロバナンス(ソースモダリティ、タイムスタンプ、抽出器ID)です。

クロスイベント構造は、エンティティではなくイベントをアンカーとする二つの軽量グラフによって捉えられます。エピソードグラフ G_E は具体的なクロスイベントリンク(共有エンティティ、オブジェクト、シーン、トピック、時間的遷移)をエンコードします。意味グラフ G_S は高レベルの規則性(ルーティン、習慣、繰り返し関係)をエンコードし、各意味ノードはそれを実体化するサポートイベントへの逆参照を持つことが求められます。このグラウンディング制約により、意味ファクトが証拠から乖離することを防ぎます。

EM^2Memの概要:イベントパース、R_i\mathcal{C}_i によるメモリセル構築、エピソード・意味グラフ G_EG_S によるリンク。

推論時には、質問 q が二段階の検索をトリガーします。まず、軽量なスコアラーが q をイベント要約とレコードフィールドに照合することで、候補イベントセル \{M_i\} の小さなセットを選択します。次に、候補は G_EG_S に沿って拡張されます:エピソード近傍ノードは時間的・エンティティ的な継続を提供し、意味ノードはサポートイベントを付与した抽象化パターンを提供します。拡張されたセットは、クエリ固有の証拠ビューにコンパイルされます——整合されたモダリティとプロバナンスを含む、イベントごとのコンパクトな一ブロック——これがLLMの回答生成に供されます。

スケルトンを再実装するための主要な設計上の選択:(i) 生動画に対するイベントセグメンタ(ショット・アクティビティ変化からの時間境界);(ii) 共通イベントIDを用いて R_i を複数モダリティにわたって埋めるイベントごとの抽出パス;(iii) イベントをファーストクラスノードとし、エンティティと意味ファクトをイベントへの逆ポインタを持つ型付き近傍とするグラフ構築;(iv) フラグメントではなくイベントをスコアリングし、グラフエッジを介して拡張する検索;(v) 検索された各セルを、モダリティ固有のヒットを連結するのではなく、単一の整合ブロックとしてシリアライズする証拠コンパイラ。

結果

EM^2Memは、異なる条件設定を持つ三つの選択式長尺動画QAベンチマークで評価されています:EgoLifeQA(週単位のエゴセントリック)、Ego-R1 Bench(超長尺エゴセントリック推論)、Video-MME (L)(オープンドメイン長尺動画)。最も強い先行メモリベースラインに対して、三つのベンチマークでそれぞれ平均精度が2.0、2.4、3.7ポイント向上しています。

精度に加えて、論文はメモリシステムにとって重要な二つの運用メトリクスを報告しています。厳密なイベントレベルTop-5証拠リコール——検索されたTop-5がゴールドイベントを含むか——は7.0ポイント向上しており、イベントインデックス検索がフラグメントインデックス検索よりも真に優れた局所化を実現していることを示しています(LLMがノイズの多いコンテキストを補完しているだけではありません)。クエリあたりのレイテンシは4.67倍削減され、総推論トークン数は63.66%削減されました。これは、イベントごとに整合ブロック一つをコンパイルすることで、キャプション・要約・グラフファクトの連結に典型的な冗長なマルチフラグメントコンテキストが置き換えられるためです。

限界と未解決の問題

いくつかの点が抄録では十分に記述されていません。イベントセグメンテーションの品質が後続のすべてを規定しますが、境界エラーや過分割・過少分割に対する感度については論じられていません。意味グラフの構築——ファクトがどのように誘導され、サポートイベントへのグラウンディングがどのように強制されるか——は概念的に記述されていますが、特に長期ルーティンに対する抽出の信頼性は示された節では定量化されていません。イベントのスコアリングと G_E, G_S における拡張深度は自然なアブレーションの軸ですが、ここでは詳述されていません。得られた改善は一貫しているものの2〜4ポイントの範囲に留まるため、どの質問タイプ(時間的、因果的、エンティティ追跡、ルーティン)がイベントアンカリングから最も恩恵を受けるかを特定するために、カテゴリ別の内訳を見ることが有益でしょう。最後に、倫理的声明が指摘するように、ルーティンとエンティティを永続的なメモリに構造化することには明確なサーベイランス上の含意があり、純粋な技術的設計によっては対処できません。

なぜ重要か

LLMのための「マルチモーダルメモリ」の大半は、実質的には異種検索インデックスであり、そのフラグメントをモデルが読み取り時に再整合させなければなりません。EM^2Memはイベントアンカーを介して整合を書き込み時にシフトさせることで、証拠リコール(Top-5で+7.0ポイント)、精度(+2〜3.7ポイント)、推論コスト(レイテンシ4.67倍削減、トークン数約64%削減)を同時に改善します——これは検索拡張システムにとって珍しいパレート改善であり、基礎となるシグナルが本質的に時間的である場合にメモリをどのように構造化すべきかの一つのテンプレートとなります。

Source: https://arxiv.org/abs/2609.00551

Hacker News Signals

人工ニューラルネットワークにおける創発的シンボル構造

Source: https://arxiv.org/abs/2608.29530

本論文は、訓練済みニューラルネットワークが離散的なシンボル構造に対応する内部表現を自発的に発達させるかどうかを調査するものです——設計によるものではなく、データからの学習の帰結として。中心的な主張は、潜在的な構成的あるいは代数的構造を持つタスクに対してgradient descentで訓練されたネットワークが、ある条件下では、その活性化がシンボル式としてデコード可能な重み配置に収束するというものです。

著者らはこれを表現幾何学の観点から分析しています。具体的には、隠れ層における活性化多様体が、タスクの背後にある真のシンボル変数と整合した近似的に独立な部分空間に因子分解される条件を考察します。提案されているメカニズムは、構成的なプロセスによって生成されたデータに対して十分な容量で訓練されたネットワークは、最小記述長の解(loss景観の意味で)が生成構造を反映するものになることを見出すというものです。これは以前のmechanistic interpretabilityの研究(circuits、grokking、モジュラー算術)と緩やかに接続しつつも、より一般的な理論的枠組みを試みています。

技術的には、本論文はトポロジーと代数のツールに依拠しており、学習された表現が群論的分解を許容する条件を調べています。これはAnthropicのsuperposition研究以来活発に議論されてきた「ニューラルネットワークの表現論」の潮流を反映しています。著者らは、真のシンボル構造が既知の合成タスクについて実証的な裏付けを提供しており、潜在シンボルへのprobeが特定の層で高い精度を達成すること、そしてこの創発が訓練時間に対して単調ではない(grokkingスタイルの遅延した相転移が現れる)ことを示しています。

本研究の限界はこの種の研究に典型的なものです。合成タスクは自然な設定に一般化しない可能性があること、「シンボル構造」の定義がある程度事後的であること、そして理論的枠組みとSGDの実際のメカニクスとのギャップが依然として大きいことが挙げられます。これが実際のLLMについて何か実行可能な知見をもたらすかどうかという問いには答えられていません。それでも、この分野が長年にわたって取り組んできた問題に対する真剣な理論的試みであることは確かです。


Atlas: 空間知能のための世界モデル

Source: https://www.worldlabs.ai/blog/atlas

WorldLabs(Fei-Fei Liのスタートアップ)は、空間的・物理的推論を対象とした世界モデルであるAtlasを公開しました。本システムは、空間的に一貫した映像とnovel-view synthesisを生成できる3D対応の生成モデルとして位置付けられており、ロボティクス、シミュレーション、embodied AIへの下流応用を可能にすることが目標として掲げられています。

ブログ記事で説明されている技術的な内容は、映像生成を純粋な2D系列問題として扱うのではなく、明示的な3D構造を維持する生成モデルの学習に焦点を当てています。このアプローチは、純粋に暗黙的な2D外観統計に依存するのではなく、距離・オクルージョン・ジオメトリといったメトリック空間関係を保持する表現にシーンをエンコードするものと考えられます。これが重要である理由は、標準的なvideo diffusion model(Soraクラスのシステム)が3Dコヒーレンスに対する帰納バイアスを持たないため、フレーム間のジオメトリ一貫性を常習的に破壊するからです。

Atlasは外観とジオメトリを分離するように因子化されたlatent spaceを使用していると報告されており、シーンの残りの部分を固定したままカメラポーズやオブジェクト配置の制御可能な操作を可能にします。これはNeRF/3DGSハイブリッドアプローチや「カメラ制御付き映像生成」手法の広いクラス(例:CameraCtrl、ViewCrafter)と技術的に関連していますが、ジオメトリ推論コンポーネントのスケーリングに明確な重点が置かれているようです。

定量的なベンチマークはブログ記事で開示されておらず、これは主張を評価する上で実質的な制限となっています。定性的なデモは、散乱したシーンにおける一貫したnovel-view synthesisとオブジェクト操作を示していますが、Stable Video 3D、ZeroNVS、あるいは類似手法との制御された比較がなければ、実際の性能差を評価することは困難です。

未解決の問題は多数あります。複数の独立して動くオブジェクトを含む動的シーンに対して3D表現はどのようにスケールするのか、また推論あたりの計算コストはどの程度なのか、といった点が挙げられます。本発表が注目に値するのは、主としてチームの信頼性とその背後にある資金調達によるものであり、技術的な解説が独立した検証に足る十分な詳細を提供しているためではありません。


連続拡散言語モデル(CDLMs)

Source: https://sander.ai/2026/08/24/continuous-dlms.html

Sander Dielemansのブログ投稿は、連続拡散を言語生成に適用することへの丁寧な技術的考察です。言語は本質的に離散的であり、標準的な拡散フレームワークは連続データ多様体を前提としているため、これは非自明な問題です。

核心的な緊張関係は次の点にあります。離散拡散(MDLM、D3PM、masked diffusion)は自然な適合ですが、Gaussian diffusionが持つ表現豊かなforward processの柔軟性を犠牲にします。トークンembeddingへの連続拡散(例:Diffusion-LM、CDCD)はembedding空間で作業する必要があり、embeddingの多様体構造をどう扱うか、および推論時に離散トークンへデコードする方法という問題を引き起こします。

Dielemansはいくつかの設計上の選択を詳しく解説しています。第一に、embedding空間は平坦ではありません。エンドツーエンドで学習されたトークンembeddingは複雑な幾何学的構造でクラスタリングされており、素朴なGaussianノイズの付与はこれを尊重しません。一つのアプローチは固定embedding空間(例:凍結されたCLIPや事前学習済みLMのembeddingテーブル)を使用し、ノイズの加わったembeddingを多様体へ写すようdenoiserを学習させることです。第二に、loss関数を慎重に選択する必要があります。embedding空間における標準的なELBOは、トークンレベルのperplexityを直接最適化しません。第三に、連続embedding空間におけるclassifier-free guidanceは数学的には簡単ですが、guidanceがembeddingを多様体から外れた方向へ押し出してしまうため、実験的には扱いが難しいです。

この投稿では「self-conditioning」トリック(前のdenoisingステップの出力を追加入力として使用すること)と、CDLMsにおけるその重要性について論じています。このトリックは、コヒーレントな生成に必要な関数評価の回数を大幅に削減します。引用されているベンチマーク数値は、CDLMsが標準的なLMベンチマークで自己回帰モデルとの差を縮めていることを示していますが、スケールでの一致にはまだ至っていません。

ここでの率直な評価は、CDLMsはperplexity対計算量において依然として自己回帰transformerに後れを取っているというものです。しかし、CDLMsはARモデルがネイティブには実現できない双方向生成と柔軟な長さの推論を提供します。


1.5時間で小さなTransformerを訓練したところ、多くのLLMを上回った

Source: https://mvakde.github.io/blog/44-on-arc-1/

この投稿はARC-AGI-1(Abstraction and Reasoning Corpus)に関するものであり、一般的な言語モデリングについてではありません。見出しは狭い意味では技術的に正確です。すなわち、ARCタスク向けにfine-tuningされた小さなtransformerが、汎用LLMに対してARC-AGI-1で優れた性能を示す理由は、汎用LLMがそれに最適化されていないからです。

手法について:著者は合成生成されたARC類似タスク上で小さなtransformerを訓練しています(パラメータ数の詳細は投稿内に記載されています)。これは「ニューラルネットワークによるプログラム合成」という一般的なアプローチに従ったものです。重要な洞察は、ARCタスクの出力空間が組み合わせ論的に小さい点にあります(最大30×30のグリッド、10色)。そのため、出力分布はオープンエンドな言語生成と比較して高度に制約されています。モデルは、入力・出力のデモンストレーションペアが与えられた条件のもと、出力グリッドをトークンごとに予測するように訓練されます。

訓練パイプラインにはデータ拡張(回転、反転、色の置換)が含まれており、これはARCformerやRE-ARCデータセットジェネレータなど先行研究における標準的なARC拡張手法です。1枚のGPUで1.5時間という訓練時間は、モデルサイズが小さく、タスクドメインが制約されていることを考えれば十分もっともです。

この投稿が提起している技術的に興味深い問いは次の通りです。ARCの性能が汎用LLMのサイズに対してスケールしにくい理由は、このタスクが大規模な訓練分布に対するパターンマッチングではなく、少数の例からの帰納的ルール抽出を必要とするからです。テスト分布と密接に一致した分布で訓練された小規模な特化モデルが、大規模な汎用モデルを上回ることができるのはこのためです。

限界について:ARC-AGI-1は現在すでに既知のベンチマークであり、訓練分布との重複は現実的な懸念事項です。ARC-AGI-2は大幅に難しく、このアプローチが汎化するかどうかは不明です。この投稿は新規性を主張する研究貢献というよりも、誠実な実証的報告ですが、エンジニアリングの詳細は再現可能であり、タスク特化とスケールのトレードオフに関する指摘は真剣に受け止める価値があります。


LLM推論の効率的フロンティア

Source: https://www.baseten.co/blog/the-efficient-frontier-of-llm-inference/

この記事では、Pareto効率的フロンティアの概念をLLM推論のハードウェアおよびサービング構成に適用しています。フレームワークの考え方は次の通りです:デプロイメントの制約条件(レイテンシ、スループット、コスト)の集合が与えられたとき、どの構成が被支配でないか、というものです。

技術的な内容は、推論最適化の標準的な軸を網羅しています:tensor parallelismの度合い、pipeline parallelism、KV cache量子化(FP8、INT4)、ドラフトモデルを用いたspeculative decoding、continuous batching、およびprefix cachingです。この記事では、いくつかのオープンウェイトモデルについて、H100およびA100ハードウェア上の複数の構成にわたって、tokens per second、time-to-first-token、cost per million tokensといった実測値を提示しています。

報告されている主な知見:speculative decodingはレイテンシ律速のワークロード(インタラクティブなチャット)においてレイテンシを改善しますが、スループット律速のワークロード(バッチ推論)では性能が低下します。これは、ドラフトモデルがより多くの並行リクエストを処理するために使えるメモリ帯域幅を消費してしまうためです。KV cacheのFP8への量子化は、テスト済みモデルにおいて無視できる程度の品質劣化でスループットをおよそ15〜20%回復しますが、INT4 KV cacheは長いコンテキストのタスクでパープレキシティの測定可能な増加を示します。70Bクラスのモデルにおける4GPU超のtensor parallelismは、all-reduce通信オーバーヘッドにより収穫逓減を示します。

「効率的フロンティア」というフレームワークが有用なのは、推論の最適化が真に多目的であり、適切な動作点がアプリケーションのSLAに依存するためです。バッチ翻訳パイプラインとリアルタイムのコーディングアシスタントは、同一ハードウェア上であっても最適な構成がまったく異なります。

限界:この記事はサービングインフラのベンダー(Baseten)によるものであり、モデルの選定やベンチマーク条件が自社プラットフォームの強みに有利に働いている可能性があります。数値は妥当で内部的に一貫していますが、これらをグランドトゥルースとして扱う前に、同等のハードウェアでの独立した再現実験が必要です。推論トレードオフについての考え方のフレームワーク自体は、それとは無関係に健全です。


Claude Fable 5.1 と Claude Mythos 5.1

Source: https://www.anthropic.com/claude-fable-and-mythos-5-1

Anthropicは2つの新しいモデルバリアントをリリースしました:Fable 5.1(中間層の効率的なモデルとして位置づけ)とMythos 5.1(高性能フロンティアモデルとして位置づけ)です。命名規則は、従来のHaiku/Sonnet/Opusという層別ラベリングから変更されています。

発表における技術的開示はフロンティアラボのリリースとして標準的な水準で乏しく、明記または強く示唆されている内容は以下の通りです:両モデルは少なくとも200Kトークンのcontext windowを使用し、3.x系の前世代と比較してtool useおよびagentic taskの性能が向上しており、Mythos 5.1はMMLU、GPQA、コーディング評価を含む複数の標準的なベンチマークでトップスコアを達成したと報告されています(具体的な数値は発表内に記載されていますが、通常のベンチマーク飽和に関する注意事項を踏まえて読む必要があります)。

HNのコメント数が多い(1236件)のは、技術的な内容よりも製品や価格に関する議論が主な要因です——Claudeがコーディングアシスタントやagentic pipelineに広く展開されるようになったことから、これらのモデルは商業的に重要な存在となっています。技術的な関心は、long-contextにおける忠実性の向上と sycophancyの低減という報告にあり、いずれも5.1のトレーニングランで具体的に対象とされたと述べられています。

AnthropicはConstitutional AIとRLHFに関する方法論の論文をモデルリリースとは別に公開し続けているため、発表自体にはトレーニングの変更点、アーキテクチャの改修、データ構成に関する情報は一切含まれていません。モデル名は、純粋な性能向上ではなく製品ラインの再構成を示すために、従来の層別命名から意図的に離脱したものと思われます。

研究観点から見てこのリリースが提起する最も興味深い問いは、報告されたsycophancyの低減がRLHF reward modelingの進歩を反映しているのか、それともpost-hocなプロンプトレベルの介入によるものなのか——という点ですが、発表ではこの区別については触れられていません。


エージェントメモリのファイルフォーマットとしての設計

Source: https://calpaterson.com/memoryfields.html

本稿は、AIエージェントがメモリをどのように永続化・検索すべきかについて、具体的な仕様を提案しています。この問題を、検索やembeddingの問題としてではなく、ファイルフォーマットの設計問題として捉え直している点が特徴です。現状のエージェントメモリ実装は場当たり的であり、フラットなキーバリューストア、不透明な類似検索を行うベクターデータベース、あるいは構造化されていないテキストダンプのいずれかに過ぎず、その結果としてメモリの移植性が低く、内容の検査が困難で、正確性の検証も難しいという問題意識が出発点となっています。

提案される設計では、各メモリエントリが明示的な型付きフィールドを持つ構造化レコードフォーマットを採用しています。フィールドの内容は、テキストのコンテンツ、時間的メタデータ(作成時刻・最終アクセス時刻・減衰パラメータ)、他のメモリへの連想リンク(暗黙的なembeddingの近傍ではなく明示的なグラフエッジ)、そして来歴情報(どのエージェントアクションがこのメモリを生成したか)です。減衰モデルは認知科学、具体的にはACT-Rのベースレベル活性化式から借用されており、メモリの活性化はアクセスの頻度と直近性の関数として表されます:A_i = \ln\left(\sum_{j} t_j^{-d}\right) ここで t_j は各アクセスからの経過時間、d は減衰パラメータです。

提案される検索メカニズムはハイブリッド方式です。まず活性化に基づくフィルタリング(閾値未満のメモリを除外)を行い、次に型付きフィールドに対する厳密な構造化クエリを実行し、残った候補に対してオプションでembedding類似度検索を適用します。この方式は純粋なベクター検索よりも解釈可能性が高く、各段階で失敗の診断が可能です。

また本稿は、メモリの統合——冗長なメモリのマージと、頻繁にアクセスされる短期記憶の長期記憶への昇格——についても論じており、これは階層型メモリシステムにおけるOSのページプロモーションに類似しています。

実用上の限界として、このフォーマットはエージェントフレームワークが事前にスキーマを確定させる必要があるため、オープンエンドなタスクに対しては柔軟性に欠けます。また、減衰パラメータは感度の高いハイパーパラメータですが、本稿ではチューニング可能なものとして扱われており、その指針は示されていません。アイデア自体は妥当ですが、この提案はアブレーション結果を伴う実装済みシステムではなく、設計文書の段階にとどまっています。


Fableを使って65kLoCのGoコードをRustに書き直した。コストは400ドル

Source: https://iurii.net/en/blog/posts/software-engineering/i-used-fable-to-rewrite-65kloc-to-rust/

本記事は、実際の本番コードベースに対してGoからRustへの大規模な言語移行を行うために、Claude Fable(AnthropicのモデルをおそらくAPI経由で使用)を活用した詳細なエンジニアリングの事後分析です。400ドルという数字は、書き直し全体を通じたAPIコストを指しています。

技術的なワークフローとして、著者は単一のプロンプトでファイル全体を翻訳しようとはしませんでした。代わりに、構造化されたパイプラインを使用しました。具体的には、Goのソースを論理的な単位(関数・型・インターフェース)に分解し、文脈注入(関連する型定義、インポートされたパッケージ、遭遇した特定のGoパターンに対するRustのイディオム)を伴いながら単位ごとに翻訳し、その後cargo checkを実行してコンパイラエラーをモデルにフィードバックする修復ループを回すというものです。この修復ループが技術的に興味深い部分です。Rustのborrow checkerは、機械可読で構造化された精密なエラーメッセージを生成するため、ユニット全体を再翻訳することなく的を絞った修正のための強いシグナルを提供します。

GoからRustへの翻訳問題には、本記事で列挙されている特有の難しいケースがあります。Goのインターフェースは(特にインターフェースをファーストクラスの値として使用する場合)Rustのtraitsにうまくマッピングできません。goroutineとchannelはtokioの async taskまたはstd::threadmpscへの手動マッピングが必要です。また、GoのnilableなポインタセマンティクスはRustでは明示的なOption<Box<T>>ラッピングが必要です。著者は、Fableが単純な構造体とメソッドのコードはうまく処理できたが、並行処理パターンとインターフェースが多用されたコードでは人間による大幅な介入が必要だったと述べています。

65kLoCを400ドルというコストで処理したことは、現在のAPI価格で1ドルあたり約162k LoCに相当します。これは、翻訳されたコードがおおよそ1:1のLoC比率であり、修復ループがトークン数で約2〜3倍のオーバーヘッドを加えると仮定した場合の公開されているトークンコストと整合しています。レビュー・パッチ適用・テストといった人的作業コストは相当なものであり、400ドルの数字には含まれていないと報告されています。率直な結論として、LLMによる言語移行支援は機械的な部分に対しては経済的に実行可能ですが、困難なアーキテクチャ上の意思決定には依然として人間の判断が必要です。

注目の新しいリポジトリ

2akouwu/reverify

決定論的なツールに基づくAIによる検証済みリバースエンジニアリングです。核となるアイデアは、LLMが生成したデコンパイル解析を逐語的に受け入れるのではなく、常に実際のバイナリと照合するというものです。これにより、モデルが自信を持って関数名を命名したり、バイナリの証拠と一致しない構造体レイアウトを再構築してしまうという標準的な失敗パターンを防ぎます。

このアーキテクチャは、シンボリック実行、逆アセンブラ(Ghidra/Binary Ninjとの統合が参照されています)、および制約ソルバーをオラクル層としてチェーン接続しています。LLMは仮説(変数の型、呼び出し規約、ループのセマンティクスなど)を提案し、ツールスイートはそれぞれの主張をバイナリの実際の制御フロー、バイトオフセット、およびレジスタ状態と照合して検証します。オラクルの検証に失敗した主張は棄却またはフラグが立てられ、エージェントは反復処理を行います。これは、単純なRAGのセットアップというよりも、CEGARループに近い構造です。

実用上、これが重要なのは、ハルシネーションによるシンボル名や誤った構造体サイズが下流の解析を密かに破壊してしまうためです。この検証層により、リバースエンジニアリングは「信頼して祈る」ワークフローから、すべてのアノテーションされた事実が機械的に確認された出典を持つワークフローへと変換されます。このツールはPythonでオーケストレーションされており、基盤となる逆アセンブルバックエンドへのサブプロセス呼び出しを使用しています。スループットよりも正確性が求められるCTFの自動化、マルウェアのトリアージ、および脆弱性調査パイプラインに有用です。

Source: https://github.com/2akouwu/reverify


truespar/sentio

AIエージェントに真の永続的なメールアイデンティティを付与することを目的として、Rustで書かれたフルマルチテナント対応メールサーバーです。各エージェントには専用のアドレスがプロビジョニングされ、受信メールはパースおよび正規化されて構造化JSONのwebhookとして配信され、返信はREST APIを通じて自動スレッド紐付けとともに送信されます。

プロトコルスタックは異例なほど完備しており、DKIM署名と検証、SPFおよびDMARCポリシーの強制適用、転送メール向けのARCチェーン処理、ポリシーベースのTLS強制のためのMTA-STS、そしてTLSAレコードに基づく証明書ピンニングのためのDANEをサポートしています。アンチスパムは3層構成で実行されます(おそらくヘッダー解析、コンテンツスコアリング、レピュテーション照会と思われますが、具体的な実装依存します)。スタック全体が単一のRustバイナリとして提供されるため、Postfix/Dovecot/Rspamdのような複雑な構成を必要とせず、デプロイが簡潔です。

この設計は、非同期かつ現実世界の通信チャネルを必要とするエージェント的ワークフローに適しています。確認メールを送信して返信webhookを待機できるエージェントは、HTTPのAPIのみに制限されたエージェントと比べて、実質的に高い能力を持ちます。マルチテナントプロビジョニングモデルにより、単一のデプロイで多数の独立したエージェントをアドレス衝突なしに運用できます。メールを通じて人間とやり取りする自律システムを構築するセキュリティ研究者や開発者にとって、これはSaaS ESPのラッパーではなく、そのままドロップインできるメールインフラストラクチャレイヤーです。

Source: https://github.com/truespar/sentio


Player-YN/PawWork_ZhuaZhua

選択優先型のWebエージェントを実装したChrome拡張機能です。ユーザーがライブページ上のDOM要素を選択し、望む出力を記述すると、エージェントがその結果を抽出・変換し、編集可能なOfficeファイル(XLSX、DOCX)に書き込みます。このインタラクションモデルは、従来の「すべてを自然言語で記述する」アプローチを逆転させたものです。レンダリングされたページ上での空間的な選択により、どのノードを操作すべきかについてLLMに正確なgroundingを与え、曖昧性を低減します。

実行は完全にクライアントサイドで行われ、拡張機能内でサンドボックス化されているため、データがバックエンドを経由することはありません。ユーザーは自身のAPIキーを提供するBYOK方式を採用しており、信頼境界はブラウザと選択したLLMプロバイダーの間に存在し、サードパーティのサービスには及びません。エージェントのaction spaceは読み取りとファイル書き込み操作に限定されており、フルのcomputer-useエージェントと比較してblast radiusが抑制されています。

選択を構造化された入力シグナルとして用いることで、DOM重視の抽出タスクにおけるgroundingの問題を大幅に絞り込めるというデモンストレーションとして、技術的に興味深い事例です。編集可能なファイル形式での出力は実用的であり、下流のユーザーは最終的なテキストダンプではなく、修正可能な成果物を得ることができます。安定したAPIのないページから構造化データをスクレイピングする研究者や、サーバーサイドのオーケストレーションレイヤーを用いない軽量なRPAワークフローの構築に有用です。

Source: https://github.com/Player-YN/PawWork_ZhuaZhua


antinomie-lab/pi-book

本番エージェントシステムを構築する際のエンジニアリング上の意思決定を取り上げたアーキテクチャノートブックであり、マーケティング的な文章ではなく、ソースに裏付けられた散文として執筆されています。「ソースに裏付けられた」という枠組みは、主張がコード・設定・参照実装に紐付けられており、純粋に概念的なものではないことを示しています。

内容は、多くのエージェントチュートリアルが省略している設計レイヤーを対象としています。すなわち、memory・ツールのdispatch・コンテキスト管理・障害からの回復が、長期タスクにおいても劣化しないシステムへとどのように組み合わさるかという点です。マルチエージェントの協調パターン・永続的な状態管理・オーケストレーションロジックとモデル能力の境界といったトピックが含まれているとされています。

これはライブラリではなく参照資料であり、その価値は意思決定の傍らに記録された推論にあります。この推論は通常、公開されたコードベースから取り除かれてしまうものです。エージェントフレームワークを構築・評価しているPhDレベルの読者にとっての興味は、著者たちがどのようなアーキテクチャ上のコミットメントを行い、特に状態表現とtool-callの信頼性に関してどのようなトレードオフを受け入れたかを把握することにあります。当ラボのRust/システム寄りの色合いから、ノートはprompt engineeringよりもインフラストラクチャに傾いていることが示唆されます。障害モードや運用上の懸念を省略している多くのエージェントアーキテクチャ図に対する対抗的視点として有用です。

Source: https://github.com/antinomie-lab/pi-book


PicoMQ/picomq

デプロイメントのスペクトラムにおいて軽量端を狙った耐久性のあるメッセージストリームブローカーです。「Kafkaを運用する」と「プロセス内キューを使う」の間のニッチを埋めることを目的としています。耐久性が主要な設計上の制約であり、プロセス再起動後もメッセージが生き残ることが保証されます。これにより、Redis pub/subおよびほとんどの組み込みブローカーは選択肢から外れます。

実装は「Pico」という命名と一致して、運用上のフットプリントを最小化することを目標としています。アーキテクチャはおそらく、永続化のためのappend-onlyログ(標準的な耐久ストリームプリミティブ)を使用し、コンシューマーのオフセット追跡はログ自体、または小型の組み込みKVストアで行われると考えられます。分散コンセンサスレイヤーを持たないため、運用モデルはレプリケーション耐久ではなくシングルノード耐久となっており、エッジデプロイメント、IoTゲートウェイ、またはKafkaクラスの複雑さが正当化できない開発環境に適しています。

システム開発者にとって興味深い問いは、クラッシュシナリオ下での耐久性保証、すなわちfsyncポリシー、先行書き込みロギング(write-ahead logging)の規律、およびリカバリパスです。これらが実際に耐久ブローカーを差別化する軸です。スター数から見るとまだ初期段階のプロジェクトですが、実在するギャップを埋めています。ほとんどの軽量ブローカーはシンプルさのために耐久性を犠牲にし、ほとんどの耐久ブローカーはJVMやマルチプロセスのデプロイメントを必要とします。制約のあるハードウェアで配信保証セマンティクスを必要とするチームにとって、注目に値するプロジェクトです。

Source: https://github.com/PicoMQ/picomq


mbm110/MSN-GUARD

Rustコアを持つネイティブAndroid VPNクライアントで、MASQUE over HTTP/3(QUICを使用するIETFプロキシプロトコル)、WireGuard、Cloudflare WARP-over-WARP(ダブルホップ)、そして検閲回避シナリオ向けのPsiphonおよびTorという、異例なほど幅広いトンネリングプロトコルをサポートしています。単一クライアントにこれらを組み合わせている点が差別化要素であり、ほとんどのAndroid VPNアプリは一つのプロトコルファミリーに特化しています。

Rustの実装はデータプレーンを担当しています。これは、パケット処理コードにおけるメモリ安全性が重要視される現代のVPNクライアントでは標準的なアプローチです。AndroidのVpnService APIがTUNインターフェースを提供し、Rustレイヤーがプロトコルネゴシエーション、トンネル確立、およびトラフィックルーティングを処理します。MASQUEのサポートは注目に値します。HTTP/3ベースのトンネリングは、制限的なネットワーク環境において重要な、WireGuardの特徴的なUDPハンドシェイクと比べてフィンガープリントによる識別や遮断が困難だからです。

WARP-on-WARPは、Cloudflareのネットワークを介した二ホップアーキテクチャを意味し、レイテンシを犠牲にしてエントリーポイントとエグジットポイントの分離を実現します。PsiphonとTorの統合は、単一プロトコルのクライアントでは不十分な高度な検閲環境を主要なユースケースとして想定していることを示唆しています。この分野のセキュリティ研究者や開発者にとって、Rustコアアーキテクチャとマルチプロトコルディスパッチロジックが技術的に興味深いコンポーネントです。

Source: https://github.com/mbm110/MSN-GUARD


zhaoxuya520/MeshLAN

Nebula(Slackのオープンソースオーバーレイネットワーク)の上に構築されたセルフホスト型仮想LANです。Nebulaの既存の証明書ベースのmeshに加えて、サービス共有レイヤー、マルチリレーサポート、およびAI駆動の自動化機能を追加しています。NebulaはP2Pの暗号化トンネルおよびNATトラバーサルを提供し、MeshLANはmesh全体でサービスを公開・検出するためのアプリケーション層のプリミティブを追加します。

マルチリレー構成は、直接のピア接続が失敗するような高度に制限された環境におけるNebulaの既知の制約に対処するものです。リレーノードを経由してカスケードすることで、レイテンシのコストはかかるものの接続性を維持します。サービス共有とは、参加者がローカルポートを名前付きのmeshサービスとして公開できることを意味しており、実質的にオーバーレイをサイドカープロキシアーキテクチャなしのプライベートサービスmeshとして機能させます。

AI自動化レイヤーは定義が曖昧なコンポーネントです。ネットワークツールにおける「AI自動化」の現状を踏まえると、LLMを活用した構成生成や、異常検知に基づくアクセスポリシーの提案といった用途が考えられます。セルフホスト・P2P優先の設計により、SaaSオーバーレイネットワーク(Tailscale、ZeroTier)が選択肢にない場合のhomelab連合、小規模チームの内部ツール、またはプライバシーに敏感なデプロイメントに適しています。基盤となるNebulaの依存関係を通じたRust近傍のツールチェーンにより、コントロールプレーンにおいて合理的なパフォーマンスを提供します。

Source: https://github.com/zhaoxuya520/MeshLAN


vercel-labs/eve-software-factory-template

Foreman と呼ばれるエージェントをオーケストレーターとして、「ソフトウェアファクトリー」パターンを具現化した Next.js ベースのテンプレートです。このデザインはソフトウェア開発パイプラインをマルチエージェントシステムとしてモデル化しており、Foreman が高レベルのタスクを解釈してコード生成・テスト・レビュー・デプロイの各ステップを担う専門化されたサブエージェントにディスパッチし、Vercel のインフラが実行環境を提供します。

技術的な本質はオーケストレーション層にあります。具体的には、Foreman がタスクを有向ワークフローに分解する方法、次のステージに進む前にサブエージェントの出力が検証される方法、そして human-in-the-loop チェックポイントが挿入される方法です。Vercel Labs リリースとして、AI SDK を活用しており、パイプラインステージの調整にストリーミング function call やツール使用 API を使用していると考えられます。

テンプレート形式であることにより、アーキテクチャはサービス境界の背後にロックされることなく、検査可能かつフォーク可能です。オーケストレーションロジック、prompt テンプレート、エージェント引き継ぎプロトコルはすべて変更可能です。これは、本番環境へのドロップイン導入システムとしてではなく、実際のインフラ上で動作するマルチエージェント開発パイプラインの具体的な実証例として最も有用です。エージェント型コーディングシステムを研究する方は、タスク分解ロジックと、ステージ間の障害処理パスを重点的に調べるべきです。後者は、ファクトリーパターンのエージェントシステムが実際に破綻しやすい箇所として典型的に挙げられます。

Source: https://github.com/vercel-labs/eve-software-factory-template