デイリーAIダイジェスト — 2026-09-07

公開

2026年9月7日

English · 日本語

arXiv ハイライト

二層協調反省:マルチエージェントLLMシステムへのゲーム理論的アプローチ

オーケストレーターがタスクをワーカーに分解し、テキストによる反省を繰り返すマルチエージェントLLMシステムは、モノリシックなpromptingを一貫して上回りますが、協調がいつ成功し、反省がいつ役立ち、自己批判がいつ根本的に不十分であるかについての理論的説明を欠いています。本論文はその説明を構築します。オーケストレーターとワーカーの相互作用を二層協調ゲームとしてモデル化し、反省を意味論的メモリ状態上のマルコフ過程として分析し、メモリ更新のための受理ゲートについて、transcript のみの場合と環境に基づいた場合との間の情報理論的分離を証明します。

二層ゲームと近似ポテンシャル構造

オーケストレーター(リーダー)は、クエリ q をサブタスクに分割する分解 \tau=(\tau_1,\ldots,\tau_N)\sim p_{\text{LLM}}(\cdot\mid q) をサンプリングし、各ワーカー i(フォロワー)は x_i\sim p_{\text{LLM}}(\cdot\mid\tau_i) をサンプリングします。大域的効用は次のように分解されます:

U(x)=\sum_{i=1}^N u_i(x_i\mid\tau_i)+\sum_{(i,j)\in\mathcal{E}}\psi_{ij}(x_i,x_j\mid\tau_i,\tau_j),

ここで最大次数 d_{\max} の相互作用グラフ \mathcal{E} 上での有界結合項 |\psi_{ij}|\le\kappa を持ちます。これはCandogan et al.(2011)の標準的な弱結合分解をLLMエージェントに転用したものです:\kappa=0 は独立なケースを回復し、(\kappa,d_{\max}) が分解品質を共同で定量化します。

補題1は、ワーカーのサブゲームがポテンシャル \mathbb{E}[U(x)] と次のスラックを持つ \eta_c-近似ポテンシャルゲームであることを示します:

\eta_c\le 2 d_{\max}\kappa.

証明は一行で済みます:ワーカー i による一方的な逸脱は \mathbb{E}[U] を局所的な効用変化と、それぞれ 2\kappa で有界な d_{\max} 項を最大限合計する結合残差 \Delta_i^\psi の分だけ変化させます。この帰結はアーキテクチャ的なものです:オーケストレーターが小さい d_{\max}\kappa を持つ分解を生成する限り、自身の実行メモリ m_e 上で局所的に \eta_c-より良い応答をするワーカーは、結合問題を推論することなく、スラック \eta_c まで大域的目標を上昇させます。

二層協調反省

図が示す二時間スケールの構図——戦略的メモリ m_o へのオーケストレーターの遅い更新と、実行メモリ m_e へのワーカーの速い更新——は、まさにポテンシャルゲームのスラック境界が正当化するものです。フォロワーのサブゲームがポテンシャルを持つため、\tau を固定してワーカーを収束させ、その後 \tau を更新することが可能であり、\kappa が小さい限りワーカー間の外部性からの振動は生じません。

メモリ状態の動力学としての反省とゲーティングの不可能性

反省は、意味論的メモリ状態上の確率的移動としてモデル化されます。自由形式の反省(提案されたメモリ書き換えの無条件受理)について、本論文は有限時間での改善の上限を導出し、最悪ケースの緊密性を証明し、偽証可能な持続的害条件の下で害の正の下限を確立します——すなわち、自由形式の反省は敵対的なケースでメモリを劣化させうることが証明可能です。

中心的な否定的結果は情報理論的なものです:生成された transcript のみを観測する受理ゲートは、テキスト上区別不能な環境のクラスに対して一様に改善することができません。同一の transcript を生成するが異なる ground truth を持つ二つの環境は、構成上、任意の transcript のみの批評家にとって区別不能であり、一方で受理するゲートは他方でも受理しなければなりません。環境に基づくゲート——transcript の外部のシグナルを照会するもの——はこの対称性を破ります。

SRMA

この分離に動機づけられ、本論文はStochastic Reflective Memory Ascent(SRMA)を提案します:候補メモリ更新 m' は、基準 m に対して基礎付きの評価リスクが厳密に減少する場合にのみ受理されます。リスク推定器のキャリブレーションと非退化なカバレッジの下で、SRMAはメモリ上の単調改善プロセスであり、上述のポテンシャルゲーム分析が誘導されたワーカーの動力学を統制します。

実験

評価はResource Contest(RC)、Overcooked、およびSWE-benchを凍結されたMiniMax-M2.7ワーカーで用いており、すべてのメトリクスは環境の ground truth またはリポジトリのテストハーネスから得られ、LLMジャッジは使用していません。

Overcooked(スコア = 配達回数 \times 20、5シード、相互作用とモデルコールの予算を統一)では、SRMAは3つのレイアウト全体ですべてのアブレーションを支配します:cramped_room 320\pm20280\pm40(self-gated)、240\pm60(free-form)、180\pm40(メモリなし)、120\pm40(greedy);asymmetric_advantages 280\pm20220\pm40 self-gated;centre_pots 260\pm20200\pm40 self-gated。greedy < メモリなし < free-form < self-gated < SRMAという順序は理論と一致しています:transcript のみのself-gatingは有益ですが、基礎付きゲーティングに支配されます。

Resource Contestでは、SRMAはオラクル報酬の 98.5\%99.5\% に達します:easy 118.4/120、hard 159.2/160、many 177.3/180。実行メモリのアブレーションは平均 2.6 ポイントの改善と、平均後悔の 4.33 から 1.7060.8\%)への削減を示し、基礎付きのラウンドごとのクリッピング証拠がメモリとして保持されると、断片的なエピソードフィードバックではなく、オーケストレーターにとって機能的な協調チャネルになることを実証しています。

限界

ポテンシャルゲームのスラック \eta_c\le 2d_{\max}\kappa は、分解が実際に弱結合である場合にのみ有用です。理論はオーケストレーターがそのような \tau をどのように見つけるかについては何も述べておらず、大きい d_{\max}\kappa を持つ病的な分解は保証の範囲外です。SRMAの単調性は基礎付きリスク推定器のキャリブレーションに依存しており——誤キャリブレーションは自由形式の最悪ケースを再導入します。不可能性結果はテキスト上区別不能クラスに対する一様改善についてのものであり、transcript のみのゲートによる平均ケースの改善は排除されておらず、self-gatedの列にも可視です。最後に、RCとOvercookedはクリーンな環境報酬を持ちますが、SWE-benchはテストハーネスを使用するものの、多くの現実的なタスクにはそのような基礎付きのオラクルが欠如しており、そこでは理論の実践的な恩恵が最も少ないです。

この研究の意義

本論文は、マルチエージェントLLM設計に対して、これまで大きく欠けていたものを提供します:反省モードの間の偽証可能な分離であり、自己批判が基礎付き批判より劣るという情報理論的な理由と、分解品質が協調スラックを制御するというゲーム理論的な理由を伴っています。RCでの 60.8\% の後悔削減とOvercookedの単調な順序は、これらの理論的区別がどのアブレーションが実際に役立つかを予測することの具体的な証拠です。

Source: https://arxiv.org/abs/2609.02750

Don’t Drop Dropout: Optimizing Layer Sparsity for Efficient LLM Training and Inference

Layer dropout(確率的深さ)は、スケール時に精度が低下するという初期の報告を受けて、現代のLLM事前学習レシピからほぼ姿を消しました。本論文は、その消滅が時期尚早であったと主張します:ハイパーパラメータ、分布、粒度、時間スケジュールを共同最適化することで、layer dropoutは密なモデルの validation loss に匹敵するかそれを上回りながら学習FLOPsを最大25%削減し、さらに学習済みモデルに「elastic depth」——early exit、layer skipping、推論時の self-speculative decoding に対する頑健性——を付与します。

統一的なメカニズムとしての layer dropout(学習と推論)

設定と定式化

著者らは、Chinchilla最適なパラメータあたり20トークンで、デコーダのみの transformer(ALiBi、squared-ReLU、Llama3 tokenizer)を学習します。Layer dropoutは残差更新

\mathbf{H}^{\ell+1,t} = \mathbf{H}^{\ell,t} + f^\ell(\mathbf{H}^{\ell,t})

をBernoulliゲート付きの形式

\mathbf{H}^{\ell+1,t} = \mathbf{H}^{\ell,t} + r_{\text{train}}^{\ell,t}\, \mathbf{M}^{\ell,t}\, f^\ell(\mathbf{H}^{\ell,t}),\quad \mathbf{M}^{\ell,t}\sim\text{Bernoulli}(1-p^{\ell,t})

に置き換えます。重要な点として、マスキングはトークンごとではなくバッチ内のシーケンスごとに行われるため、効率的な実装では f^\ell を生き残ったシーケンスにのみ実行し、理論的なレート p^{\ell,t} がそのまま同じ割合のFLOPs削減に直結します。

設計の軸

本論文は、先行研究が混同していた4つの軸を体系的にアブレーションします:

  1. ハイパーパラメータ。 Learning rate、batch size、weight decay、初期化をベース設定のdropout rateごとに再チューニングし、\muP/CompleteP/Power Linesでスケールさせます。これにより、dropoutの効果を「ハイパーパラメータ抽選」から切り離します。
  2. 粒度。 Sub-layer dropoutはattentionとFFNブロックに対して独立したマスクをサンプリングし、layer dropoutはそれらを結びつけます(\mathbf{M}_{\text{attn}}^{\ell,t} = \mathbf{M}_{\text{ffn}}^{\ell,t})。
  3. 深さ方向の分布。 平均レート p_{\text{mean}} \approx 0.5 p_{\max} を揃えた3つの代表的な選択肢:uniform(全層に p_{\max})、Increasing Linear Dropout(ILD、p^\ell = \frac{\ell}{L-1} p_{\max})、Alternating Layer Dropout(ALD、奇数層に p_{\max})。ILDは浅い層をほぼ常に活性化させ、浅い層がより不可欠な計算を担うという証拠と一致します。
  4. 時間スケジュール。 定数スケジュールと減衰スケジュール(DTS)で、後者ではdropout rateが学習中にゼロまでアニールされます。DTSが推奨されるデフォルトです。

勝利レシピは ILD + DTS:dropoutが深さとともに増加し、学習ステップとともに減衰します。

学習効率の結果

学習FLOPsを揃えた条件では、ILD+DTSは validation loss において密なベースラインに匹敵するか上回ります。別の見方をすれば、validation lossを揃えた条件では、layer dropoutは学習FLOPsを最大25%削減します。スケーリング分析では、ILD+DTSは計算最適点を大きく超えた高TPPでも密なベースラインの validation loss から≈0.5%以内に留まり、正則化・構造的な恩恵がスケールとともに消えないことを示しています。

推論時のelastic depth

より特徴的な貢献は、layer dropoutによる事前学習が、fine-tuningなしに、深さ方向の推論最適化に対してネイティブに対応可能なモデルを生み出すことです:

  • 静的 early exit。 密なモデルでは、1層早く終了するだけで loss が急激に悪化します。Dropout学習済みモデルは緩やかに劣化し、p_{\max} が大きいほどearly exitの曲線が平坦になります。特筆すべき点として、減衰スケジュール(学習終了時にdropoutがゼロになる)でもearly exitの頑健性が維持され、この効果が一時的な学習レジームではなく学習済み表現の持続的な性質であることを示しています。
  • Layer skipping と self-speculative decoding。 密な3.9Bモデルでは交互の層をスキップするとほぼ使い物にならない(loss 6.446)ですが、p_{\max}=0.8 では2.129まで、p_{\max}=0.99 の8.2Bモデルでは1.991まで改善します。

大規模実験

最も顕著な数値は、1.8B/3.9B/8.2Bパラメータにおける積極的な p_{\max} から得られます。3.9Bで p_{\max}=0.8(ILD+DTS)の場合、初期化時の実効深さはわずか (1 - 0.5 p_{\max})L = 0.6L であり、最終層は80%の時間スキップされます。Table 5の結果:

モデル p_{\max} FLOPs削減 Val loss Skip-alt loss Early exit @0.75L Spec-decode speedup
1.8B dense 0 0% 1.849 4.260 3.943 1.10×
1.8B 0.6 15% 1.836 2.282 2.329 1.34×
3.9B dense 0 0% 1.732 6.446 3.834 1.02×
3.9B 0.8 20% 1.745 2.129 2.143 1.54×
8.2B 0.99 25% 1.663 1.991 1.777 1.55×

Validation lossはほぼ変わらず(8.2Bではより低く)、一方で深さ方向の推論指標はいずれも大幅に改善し、エンドツーエンドの self-speculative decoding は約1.5×のwall-clock speedupを達成しています。サイズをまたいだ傾向は、より大きいモデルがより積極的な p_{\max} を許容することを示唆しており、深さ方向の冗長性が内在的に大きいことと一致しています。

限界と未解決の問題

いくつかのギャップが残っています。本研究は事前学習済みの重みを変更しない手法に限定しており、fine-tuningベースのプルーニング(Sheared LLaMAなど)は対象外であり、そちらとの比較は不明確です。静的な early exit のみが評価されており、学習済みルーターによる動的なトークンごとのearly exitというより実用的な手法は推測に留まっています。ALDはearly exitにおいて平均dropout率が同じにもかかわらずILDより劣ることが示されていますが、その機械論的な説明は本論文では完全にはなされていません。8.2Bにおける極端な p_{\max}=0.99 は最適化ダイナミクスについて疑問を提起します:学習初期に上位層が1%未満しか見られない場合、loss landscapeはどのような形状になるのか、また事後学習によるアライメントとの相互作用はどうなるのか。最後に、すべての実験はALiBi + squared-ReLU + 特定の \muP レシピを使用しており、RoPE + SwiGLU スタックへの転用は主張されていますが実証されていません。

なぜこれが重要か

Layer dropoutは推論時には本質的にフリーです(学習時の摂動であるため)が、事前学習FLOPsの約15〜25%割引と、無視できる loss 増加で1.5×の speedup を実現するelastic-depth推論をネイティブにサポートするモデルの両方をもたらします。このレシピが本番スタックでの独立した再現実験において通用するならば、「常にILD+DTSで学習する」という変更は、計算予算の両側に複合的な恩恵をもたらす標準的なLLM事前学習への安価な改変となります。

Source: https://arxiv.org/abs/2609.05275

RISE: Recursive Improvement via Self-Extrapolating Policy Distillation

問題設定

On-policy distillation(OPD)は、スカラーのRLVR報酬では与えられないトークンごとの監督信号を提供しますが、その価値は教師モデルに制約されます。外部教師は学習者のon-policyなロールアウトに対して分布ミスマッチを引き起こし、privilegedな条件付けによる自己蒸留(例えば、兄弟関係にある正解を学習者に与える手法)は学習者自身のin-context learning能力に限定されるため、「教師」は「学習者」とほとんど同等の強さしか持ちません。RISEが問うのは、RLVRの軌跡のみを用いて現在のポリシーよりも厳密に強い合成教師を構築し、それを活用してスパースな結果報酬を密なトークンレベルのターゲットに変換できるか、という点です。

手法

\pi_{\theta_n}を現在のポリシー、\pi_{\theta_{n+1}'}をそのRLVRによる更新(1ステップのGRPO、あるいは複数ステップのブロック)とします。RISEは線形演算が意味を持つ表現空間\varphiを選択し、以下のように外挿します:

\varphi(\pi_{\text{future}}) = \varphi(\pi_{\theta_n}) + \beta \cdot \big(\varphi(\pi_{\theta_{n+1}'}) - \varphi(\pi_{\theta_n})\big), \quad \beta > 1.

2つの具体的な実装が存在します:

  • 重み空間\varphi = \theta): \theta_{\text{future}} = \theta_n + \beta(\theta_{n+1}' - \theta_n)、すなわち外挿係数が>1のtask-arithmeticステップです。教師は\theta_{\text{future}}でインスタンス化されたモデルです。
  • ロジット空間\varphi = \log \pi): \log \pi_{\text{future}}(\cdot \mid s_t) = \log \pi_{\theta_n} + \beta(\log \pi_{\theta_{n+1}'} - \log \pi_{\theta_n}) + \text{const}、これは幾何混合\pi_{\text{future}} \propto \pi_{\theta_n}^{1-\beta} \cdot \pi_{\theta_{n+1}'}^{\beta}であり、RLVR前後のポリシー間の尤度比を増幅します。

f(\theta_n + \beta \Delta\theta) \approx f(\theta_n) + \beta \Delta fであることから、ロジット空間は\theta_n周りの重み空間に対する1次テイラー近似であり、fが線形の場合にのみ両者は一致します。

KL分解がこの手法の中核的なメカニズム的洞察です:

D_{\mathrm{KL}}(\pi_\theta \| \pi_{\text{future}}) = -(\beta - 1) D_{\mathrm{KL}}(\pi_\theta \| \pi_{\theta_n}) + \beta D_{\mathrm{KL}}(\pi_\theta \| \pi_{\theta_{n+1}'}) + \log Z.

\beta > 1かつ両方のアンカーがstop-gradientである場合、第1項の係数はとなります——これはRLVRによる改善方向を延長する、後方アンカー\pi_{\theta_n}からの反発項として機能します——一方、第2項は\pi_{\theta_{n+1}'}への引力として働き、オーバーシュートを抑制します。いずれもトークンレベルであり、スカラー報酬では実現できないクレジット割り当てを提供します。後方アンカーはEMA(Qwenでは\eta = 0.1、OLMoでは\eta = 1/直前のチェックポイント)によって更新されるため、学習者が改善するにつれて教師も改善します——これが「recursive(再帰的)」と呼ばれる所以です。

デフォルトスケジュール:\beta_0 = 1.2から\beta_N = 1へ線形減衰;蒸留はK = 100ステップごとに適用(出力分布がよりピーキーなコードタスクではK = 20);蒸留lossとしてforward KLではなくJS divergenceを使用します。

実験

実験は4つのモデルファミリーにわたります:数学的推論(DAPOMath上のQwen3-8B / 1.7B / 1.7B-Base、OpenR1-Math-46K上のOLMo3-7B-Instruct-SFT)、多領域STEM(低複雑度の数学部分をDAPOMathに置き換えたGuru形式のミックス上のQwen3-4B-Base)、コード(Skywork-OR1-Code上のQwen3-8B-Base)、エージェント型タスク(ALFWorldおよびWebShop上のQwen2.5-3B-Instruct)。OOD評価にはGPQA-Diamond、IFEval、MMLU-Proを使用します。蒸留に関するハイパーパラメータ以外はすべてGRPOベースラインと同一であり、1エポックの学習を行います。

ベースラインは、GRPOと privilegedな自己教師(学習者に兄弟関係にある正解を条件付けする)を組み合わせるが統合方法が異なる3つのOPSD手法です:GRPO+SDPO(補助KL)、SDAR(教師と学習者の確率差によってゲートされたadvantage)、RLSD(advantageの再重み付け)。外部教師によるOPDは、RISEおよびOPSDベースラインとは異なり別途強力なモデルを必要とするため除外されます。

abstractおよびセットアップによれば、RISEはモデルのスケールおよびファミリーを通じてRLVRのみ(GRPO)およびOPSDベースラインの両方を上回り、OOD性能を保ちながらin-domainの精度を向上させます——具体的な数値テーブルは本稿で示されていないため、最も強い主張として記録すべきは:(i)著者らが提起する5つの問いにわたってメカニズムが検証されており、スケールおよびファミリーの頑健性も含まれる点、および(ii)学習者が改善するにつれて教師も改善し、蒸留が一回限りではなく再帰的になる点です。

限界と未解決の問題

  • ロジット空間と重み空間のRISE間のテイラー近似ギャップは定量的に有界化されていません;\betaが大きい場合や学習後半ではfの高次項が重要になる可能性が高く、デフォルトスケジュール(\beta_0 = 1.2から1へ減衰)は保守的です——教師が崩壊する前にどこまで\betaを大きくできるかは不明です。
  • 重み空間の外挿は第2のパラメータ化に対してフルのforward passを必要とします;より計算コストの低いロジット空間形式との計算量・品質のトレードオフは、本稿で示された内容では十分に特徴付けられていません。
  • EMAアンカーレート\etaは感度が高いようです(QwenとOLMoで異なる値)。原則的な選択ルールが存在しません。
  • KL分解は両方のアンカーをstop-gradientとして扱います;\pi_{\theta_{n+1}'}(1回のRLVRステップを除いて\pi_\thetaとパラメータを共有する)を通じて勾配を伝播することが学習を改善するか不安定化するかは未解決です。
  • すべての結果は1エポックのものです;\pi_{\theta_n}\pi_{\theta_{n+1}'}が収束して\Delta \varphi \to 0となるにつれて再帰的な教師の更新が多くのエポックにわたって利得をもたらし続けるか、あるいは飽和するかは示されていません。

この研究の意義

RISEは、モデル自身の軌跡を外挿することでRLVRのスパースな結果報酬を密なトークンレベルの監督信号へと変換する、クリーンで教師モデル不要な手法を提供します——task arithmeticを蒸留教師として再解釈し、「自分自身からのon-policy蒸留」がGRPOを上回り得る理由を原理的に説明するKL反発メカニズムを明らかにします。再帰的な教師の更新が複利的に効果をもたらし続けるならば、これは外部の強力なモデルを必要とせずに検証器ベースのRLと密な監督を組み合わせるための汎用的なレシピを示唆するものです。

Source: https://arxiv.org/abs/2609.05295

Iris: 検索フロンティアへの登攀

Irisは一対の検索エージェント(Iris-miniは35B-A3B、Iris-proは397B-A17Bのアクティブ/総パラメータ数を持つMoEアーキテクチャ)であり、ReActスタイルのツール使用によるマルチホップWebサーチを実行するよう訓練されています。本論文の貢献は新規アーキテクチャよりも、厳密に設計されたデータパイプラインと、著者らが「SFT-RL climbing」と呼ぶSFT/RLの交互スケジュールにあります。研究の動機となった問題は二つあります。すなわち、自然発生的なWebの質問は非パラメトリック検索と証拠の合成の両方を必要とすることが稀であること、そして手作業で作成したマルチホップ質問はスケールしないことです。Irisはこれらの両問題を、Webコーパスのハイパーリンクグラフから逆構築的に質問を生成することで解決します。

データパイプライン:Webグラフからの逆構築

コーパスは有向グラフ G=(V,E)\mathrm{Out}(v)=\{u\mid (v,u)\in E\})としてモデル化されます。シードは回答アンカー型ポリシー v_0\sim P_\text{seed}(V) のもとでサンプリングされ、まずターゲットとなる回答エンティティを固定し、それを説明するページを検索します。シードは局所的なサブグラフへと展開されます: G_\text{sub}=(\{v_0\}\cup N, E_\text{sub}),\quad N=\{v_i\}_{i=1}^{k}\subseteq \mathrm{Out}(v_0). ページレンダラーがインラインアンカーを除去してしまうため、真の出リンク集合はRDFセマンティックミラーとレンダリング済みマークアップを統合することでリンク再現率を最大化して復元されます。これはパイプラインを再現しようとする場合に重要な、小さいながらも意義深いエンジニアリング上の工夫です。

合成ステップでは、v_0 とその近傍から蒸留されたエンティティグラフ上でマルチホップの連鎖を生成し、回答以外のすべてのエンティティを記述的な参照表現に書き換えることで、表層文字列マッチングによる問題の短絡を防ぎます。検証は二重基準で行われます。参照モデルはクローズドブック条件では質問に失敗しつつも、証拠が与えられれば成功しなければなりません。このフィルタが非自明性と解答可能性の両方を担保するものであり、検索タスクにおけるRL報酬を意味のあるものにする標準的な手法です。

SFT-RL climbing

軌跡はツール集合 \mathcal{T}=\{\textsc{search},\textsc{scrape}\} を用いたReActのもとで教師モデル M_T によって生成されます: \tau=(r_1,a_1,o_1,\dots,r_T,a_T,o_T,r_{T+1},\hat y)\sim \pi_{M_T}(\cdot\mid q,\mathcal{T}). 重要なのは、各観測 o_t が生のページではなく、その場で生成されたドキュメントレベルの要約であることです。これによりコンテキストを予算内に収めます。著者らはこの推論時のコンテキスト管理の選択が、これらのベンチマークではモデルサイズよりも重要だと主張しています。軌跡はSFTの前に軌跡レベルとターンレベルの両方でフィルタリングされます。

RLは報酬判定器と観測要約器という二つの補助サービスとともに、学習クラスタ内でライブ検索に対して実行されます。過度に長いロールアウトはリクエストレベルで中断され、次のステップではコミット済みのプレフィックスから再開されます。これにより、ツール呼び出しの状態を既に蓄積した部分的な軌跡を破棄せずに済みます。climbing手続きはループとして動作します。各RLラウンド後、最も難しく解決できたロールアウトと最もトークン効率の高いロールアウトが次のSFTパスに返されるため、SFTはRLフロンティアをベースポリシーへと継続的に蒸留します。

結果

図1:四つのagentic searchベンチマークにわたる性能比較。

評価はBrowseComp(相互に制約し合う手がかりからのロングテールエンティティ識別)、BrowseComp-ZH(中国語版)、DeepSearchQA(回答スパンの完全一致ではなく証拠カバレッジを評価)、HLE(検索がパラメトリック知識を補完する専門家レベルの学術的推論)のテキストのみのサブセットを対象としています。図1はIris-proが四つのベンチマークすべてにわたってフロンティアに位置することを示しています。Iris-miniはアクティブパラメータが3Bに過ぎないにもかかわらず、実質的に大規模なオープンベースラインと競合します。アブストラクトでは、推論時のコンテキスト管理(観測としての要約、プレフィックスからの再開、ターンレベルフィルタリング)がこれらのベンチマークにおいて不均衡に大きく貢献していることが強調されており、これはBrowseCompの性能が生の推論の深さよりも軌跡長と手がかりの集約にボトルネックがあるという観察と一致しています。

限界と失敗モード

図2:BrowseComp-ZHの質問85番。エージェントは「Bolton」と回答しているが、正解は「Lannister」である。

図2は、BrowseComp-ZHの質問85番においてエージェントが正解ラベル「Lannister」に対して「Bolton」に確定してしまうという典型的な失敗を示しています。これはより広い問題を示しています。手がかりが相互に制約し合うものの個別には弱い場合、エージェントはほとんどの制約を満たすエンティティに固執して検索を停止してしまうことがあります。逆構築パイプライン自体にも未解決の問題があります。二重基準フィルタは参照モデルのクローズドブック能力に依存しているため、ベースモデルが改善されるにつれてパイプラインの難易度ターゲットがずれていきます。また、記述的参照への書き換えステップは、LLMが言い換えの際に回答文字列を漏洩させないことを前提としています。SFT-RL交互スケジュールも要約器の品質に対する感度も、提供された抜粋ではアブレーションされておらず、climbingによる利得とコンテキスト管理ポリシーとしての要約付き観測単独による利得がどの程度かは依然として不明です。

なぜこれが重要か

Irisは、データ生成グラフ、クローズドブック/オープンブック検証フィルタ、および推論時のコンテキスト管理を後付けではなく第一級の設計選択として扱う、検索エージェント訓練のための具体的なレシピです。SFT-RL climbingループ——最も難しく解決できたRLロールアウトをSFTに戻すこと——は、いずれかの段階単独では到達できない天井を超えてagenticポリシーを押し上げるための、シンプルで再利用可能なパターンです。

Source: https://arxiv.org/abs/2609.04304

Motion-Omni: 音声対話のためのエンドツーエンドの音声と全身モーションの統合生成

問題設定

会話型アバターは、発話内容と動作を同時に決定する必要がありますが、これら二つの機能は通常、異なるモデル系統に分かれています。すなわち、音声対話モデル(SDM)は音声のみを出力し、co-speech モーションモデルは事前生成された音声を入力として受け取ります。標準的なカスケード方式——音声を生成し、その後波形にモーションモデルを適用する——では推論パスが二回必要となり、さらに重要なことに、音声とモーションの経路間の共同最適化が不可能です。SDMが行うプロソディの決定は音響的な表面を通じてしかモーションモデルに伝わらず、LLMの隠れ状態に含まれるモーション関連のシグナルは破棄されてしまいます。Motion-Omniはこの分離を解消します。すなわち、モーションは音声トークンを生成する同一の隠れ状態から直接生成され、共同の教師信号のもとで学習されます。

手法

このフレームワークは、インターフェースは固定されつつも実装を差し替え可能な四つのコンポーネントから構成されています(図1を参照)。

Motion-Omniフレームワークの四つのコンポーネントとその条件付けトポロジー。

参照インスタンスである Motion-Omni-Q7 は以下を使用します。

  • Speech Encoder. 16 kHz 波形に対する frozen Whisper-large-v3 エンコーダー(隠れ次元 1280)。Speech projector は連続する5フレームを連結し、2層の MLP を通じて LLM の embedding 空間へ射影することで、5\times の時間ダウンサンプリングを実現します。射影された特徴はトークン列中の <speech> プレースホルダーを置き換えます。

  • LLM バックボーン. Qwen2.5-7B-Instruct。Stage 1〜3 では frozen 状態で、Stage 4 では小さい学習率で fine-tuning されます。LLM は連続音声とテキストトークンの混合セグメントを入力として受け取り、文脈化された隠れ状態 H_{\text{LLM}} を出力します。

  • Speech Generator. Qwen2.5-0.5B-Instruct から初期化された Qwen2 スタイルの transformer で、語彙数 16{,}384 ユニットに3つの制御トークンを加えた語彙集合に対して、12.5 Hz で GLM-4-Voice の離散音声ユニットを自己回帰的に生成します。LLM との接続は Token-as-Query Gated Fusion(TQGF)ブロックを通じて行われます。音声トークンの embedding がクエリとして H_{\text{LLM}}(キー/バリュー)に作用し、学習された head ごとのシグモイドゲートによって、各ヘッドが LLM の文脈をどの程度取り込むかを決定します。ヘッド h に対して概略的に示すと、 \tilde{H}_h = g_h \odot \mathrm{Attn}(Q_h^{\text{tok}}, K_h^{\text{LLM}}, V_h^{\text{LLM}}), \quad g_h = \sigma(W_g x), head ごとのゲートによってモデルはトークン単位で LLM からの情報漏洩を調整することができます。

  • Motion Generator. 顔、手、上半身、下半身のそれぞれに対応する4つの並列パートデコーダーで、30 Hz で LOM VQ コードを生成します。これらのデコーダーは Speech Generator の最終層隠れ状態をキー/バリューとして条件付けし、CosyVoice の事前学習済み flow embedding から初期化された学習済み音声トークンクエリ embedding を使用します。パートデコーダーは Speech Generator のコンテキストを共有しますが、推論時には互いにサンプリングされたモーショントークンを相互参照しません——これはパート間コヒーレンスと並列デコード可能性をトレードオフする意図的な簡略化です。

推論時、音声ユニットは CosyVoice のチャンク対応 flow-matching デコーダーによって mel スペクトログラムに変換され、HiFi-GAN ボコーダーによって 22.05 kHz の音声としてレンダリングされます。モーションコードは frozen LOM VQ-VAE によって SMPL-X のボディ/ハンドパラメーターおよび FLAME の表情係数にデコードされ、人間評価のために SMPL-X メッシュ動画としてレンダリングされます。

学習データはモデル非依存のパイプラインから得られます。SDM が一貫した音声応答を生成し、差し替え可能なモーション教師モデルがそれらに疑似ラベルを付与し、ペアが品質によってランク付けされ、422{,}856 組の品質ランク付き(音声、モーション)ペアが生成されます。これにより教師信号が特定のモーション教師モデルから切り離されます——教師モデルを差し替え、ラベルを再生成するだけで済みます。

学習はステージに分けて行われます。Stage 1〜3 では LLM を frozen に保ち、Speech Generator、TQGF fusion、Motion Generator を段階的に立ち上げます。Stage 4 では音声ユニット言語モデル loss とモーション VQ コード予測 loss の両方のもとで、LLM、Speech Generator、Motion Generator を共同適応させます。論文はこの共同学習ステージが省略不可能であることを明示しています。音声経路を frozen にしたままでは、モーションが生成された音声との整合性を失い、共同適応のみが音声対話品質を犠牲にせずに整合性を回復できます。

評価

評価には SwDA-500 を使用します。これは Switchboard Dialog Act Corpus から派生した500プロンプトのセットで、66 の SwDA トピック記述すべてをカバーし、トピックごとに意味的に完結した7〜8ターンを含み、適度な長さと書き起こしアーティファクトによってフィルタリングされています。SwDA-500 にはペアになった正解モーションが存在しないため、モーションの参照データは同一プロンプトのもとで教師モデルまたはベースラインによって生成されます——評価は実際のキャプチャされたモーションとの比較ではなく、カスケードやアブレーションとの比較によるものです。

制限と未解決の課題

  • 実モーションとペアになったベンチマークがない。 SwDA-500 上のすべてのモーション参照はモデルが生成したものであるため、「モーション品質」は人間のキャプチャではなく教師モデルを基準に校正されています。絶対的なリアリズムの主張にはペアになった評価セットが必要です。
  • 推論時のパート間相互条件付けがない。 四つのパートデコーダーは共有コンテキストのもとで独立にサンプリングします。独立サンプリングがグローバルに一貫したポーズ(例:手のジェスチャーの頂点と上半身の揺れの一致)を生成するかどうかは、アーキテクチャが保証しない経験的な問いです。
  • 疑似ラベルによる教師信号。 ラベルはモーション教師モデルのバイアスや失敗モードを引き継ぎます。「差し替え可能な教師」設計はこれを軽減しますが、完全に排除はしません。
  • Frozen VQ-VAE とボコーダー。 モーションの忠実度は LOM のコードブックによって上限が決まり、音声の自然さは CosyVoice + HiFi-GAN の品質によって上限が決まります。
  • インスタンス固有の結果。 報告された数値は Q7 インスタンスに対するものであり、このフレームワークの優位性がより小さいまたは大きい LLM バックボーンに転用できるかどうかはここでは確認されていません。

重要性

Motion-Omni は、二段階のカスケード(SDM \to 音声 \to モーション)を、モーションが下流の音声からではなく LLM/Speech Generator の隠れ状態からデコードされる単一の自己回帰プロセスへと統合する具体的な実例です。共同学習の主張が定量的に有効であれば、co-speech モーションは独立した下流モジュールではなく、音声対話モデルのもう一つの出力ヘッドとして扱うべきであるという主張を支持します。

Source: https://arxiv.org/abs/2609.04250

WorldSculpt: グラウンデッドビデオからの構成的世界の生成

問題設定

単一の融合サーフェスではなく、個別にアドレス指定可能なオブジェクトメッシュの集合体として、雑然とした3Dシーンを再構成することは、下流のパイプライン(シミュレーション、ロボティクス、AR/VR、ゲームエンジン)が実際に必要とするものです。古典的な幾何学ベースのマルチビュー再構成は、オクルージョンが支配的な部分に穴のある一枚岩的な表現を生成しますが、既存の構成的生成アプローチは少数のオブジェクトを含むシーンに限定されてきました。WorldSculptは、どちらのアプローチも対処できないレジーム、すなわち各視点からは任意のインスタンスのごく一部しか見えない、数百の相互オクルーディングオブジェクトを含むシーンを対象としています。

ティーザー:数百のオブジェクトに対する構成的メッシュ出力。

セットアップと手法

入力は、内部パラメータ K_n およびカメラ-ワールド外部パラメータ T_n^{\mathrm{cw}} を持つ N 枚のポーズ付き画像 \{I_n\}、ビューごとのインスタンスマスク S_{kn}、および各オブジェクト k の粗い3D位置推定ボックス B_k^{\mathrm{loc}} です。これらはすべてオフザシェルフの検出器、セグメンタ、3Dボックス予測器から復元可能であり、本論文ではそれらを明示的に仮定した上で生成ステップに焦点を当てています。目標は

\mathcal{M}=\{(\mathcal{M}_k^{\mathrm{c}}, T_k^{\mathrm{ow}})\}_{k=1}^{K},\qquad \mathcal{M}_k^{\mathrm{w}}=T_k^{\mathrm{ow}}(\mathcal{M}_k^{\mathrm{c}}),

すなわち、各オブジェクトの正準フレームメッシュと剛体的な正準-ワールド変換マップです。

パイプラインは3つのステージで構成されています(図2)。

手法の概要:アンカーアライメントに基づく正規化、DINOv3による正準ボクセルボリュームへのリフティング、permutation-invariantな融合、ゼロ初期化レイヤーとLoRAによるPixal3D priorへの注入。
  1. アンカーアライメントに基づく正規化。 各オブジェクトに対して、B_k^{\mathrm{loc}} と選択されたアンカービューから仮想的な正準キューブを構築します。オブジェクトを見るすべての入力ビューは、クロップを考慮した内部パラメータを用いてこの正準フレームに再投影されるため、オブジェクトの範囲が各ビュー間で一貫してキューブを満たします。これにより、生成器の座標系がワールドから切り離され、事前学習に使用した単一オブジェクトの正準空間が再利用されます。

  2. マルチビュー条件付き生成。 ビューごとのDINOv3特徴量が抽出され、各ボクセルと交差するレイに沿って特徴量をアンプロジェクションすることで3D正準ボクセルボリュームにリフティングされます。Permutation-invariantなアグリゲータ(ビュー次元にわたる融合)がマルチビュー特徴スタックを単一のボリューメトリック条件付きテンソルに集約します。この3D条件は、アンカービューからのグローバル画像トークンとともに、ゼロ初期化された注入レイヤーとベースweightのLoRA adaptationを介して、Pixal3Dの単一オブジェクト3D生成priorの2つの幾何学ステージに注入されます。重要なのは、すべてのfine-tuningが正準空間内の孤立した単一オブジェクトに対して行われることであり、モデルは学習中に合成シーンを見ることはありませんが、正規化と融合のパスウェイにより、推論時に任意にオクルードされたマルチビューエビデンスを利用できます。

  3. ワールド配置。 生成された \mathcal{M}_k^{\mathrm{c}} は、正規化ステップから導出された T_k^{\mathrm{ow}} を用いてワールドフレームにマッピングされます。オブジェクトはインスタンス間での融合なしに個別にアドレス指定可能なままです。

ゼロ初期化注入とLoRAの選択は、固定された生成priorを新しい条件付けモダリティに適応させる際に、オブジェクト形状のpriorを損なわないための標準的なメカニズムです。ここでの新しいモダリティは、例えばテキストや単一画像のトークンストリームではなく、正準ボクセル特徴ボリュームです。

評価設定

3段階の難易度が使用されています。

  • Toys4k(孤立オブジェクト)は入力ビュー数を 1 から 16 まで、ビューごとのオクルージョンを 0 から 75\% まで変化させ、観測が劣化した際のマルチビュー条件付けの挙動を単独で評価します。
  • Toys4k-Scene は、Toys4kのアセットを周回キャプチャを伴う雑然とした合成レイアウトに合成し、クリーンなGTメッシュを保持しつつ、重度のオブジェクト間オクルージョンと細い構造を導入します。
  • HouseCat6D は、スキャンされたオブジェクトごとのGTを持つ実テーブルトップキャプチャを提供します。レイアウトがまばらで幾何学的にシンプルな家庭用品で構成され、sim-to-real転移のプローブとして機能します。
  • UE-MeshyScene(本論文で導入)はストレステストであり、6つのUnreal Engine 5.8環境を周回軌道に沿って 2560\times 1440 でレンダリングし、正確なオブジェクトごとのground truthを持ちます。表1によると、シーンのオブジェクト数はHangar 171、Abandoned City 93、Cathedral 145、Office 678、Japanese School 511、Desert Town 701で、合計 2{,}299 オブジェクト、5{,}964 ビューです。Desert Townシーン単体で701オブジェクト、1,254レンダリングフレームを含みます。

UE-MeshyScene:整然としたものから極めて雑然としたものまで、シーンあたり最大701オブジェクトを含む6つのフォトリアリスティックな環境と、ワールドフレーム評価のための正確なオブジェクトごとのGT。

このベンチマーク自体が一つの貢献です。従来の構成的生成データセットは、正確なGT幾何学を持つ数百オブジェクトの相互オクルージョンレジームを扱っていませんでした。

限界と未解決の問題

本手法は、信頼性の高いビューごとのインスタンスマスク S_{kn} と粗い3D位置推定ボックス B_k^{\mathrm{loc}} を入力として仮定しており、ビュー間のマスク対応付けや位置推定ボックスの失敗は直接伝播します。正準キューブが B_k^{\mathrm{loc}} にアンカーされているためです。生成器は各オブジェクトを独立して生成するため、オブジェクト間の物理的な制約(接触、非貫通、支持)は強制されません。モデルは単一の正準オブジェクトのみでfine-tuningされているため、Pixal3D priorの系統的なバイアス(学習分布で過少表現されているカテゴリ、中空の内部、または異常なトポロジー)はそのまま現れます。マルチビューパスウェイはエビデンスを提供しますが、新しい形状priorを提供するわけではありません。最後に、このベンチマークは既知のカメラによる静的シーンを評価するものであり、ノイズのあるポーズと動的なコンテンツを持つin-the-wildキャプチャへの拡張はここでは検証されていません。

重要な理由

生成priorがオブジェクトごとに学習され、シーン再構成パイプラインが一枚岩的であることから、構成的3Dシーン生成はおもちゃスケールのレジームに留まってきました。WorldSculptは、マルチビューエビデンスをオブジェクト中心に見せる正規化ステップと組み合わせた強力な単一オブジェクト3D priorが、シーンレベルの学習データなしに数百の重度オクルードされたインスタンスを含むシーンへクリーンに拡張できることを示しています。そして、UE-MeshySceneはこのレジームを測定するための明確に定義されたベンチマークをコミュニティに提供します。

Source: https://arxiv.org/abs/2609.05416

Enoki: 効率的なマルチレベル幻覚検出

LLM出力に対する幻覚検出は、クレームレベルのパイプライン(原子的な事実単位に分解して各々を検証する)とスパンレベルの検出器(サポートされていない部分文字列をマークする)という2つの陣営に分かれてきました。クレームレベルの出力は解釈可能ですが、テキスト中のどこにエラーが存在するかを示しません。スパンレベルの出力は局所化はできますが、検証可能な単位に分解されません。両者を橋渡しするには、通常2つのシステムを実行してその出力を整合させる必要があり、両ステージがLLMを呼び出す場合はコストが高くなります。Enokiは、この2つの視点をテキストにアンカーされたOpenIEトリプルという単一の表現に統合します。このトリプルは、検証可能な関係クレームと応答テキストへのポインタを両方持ちます。

手法

Enokiは、事実抽出と事実検証の2ステージに加え、決定論的な射影ステップから構成されます。

事実抽出。 応答はspaCyの文境界でセグメント化され、各文はスキーマフリーのトリプル (s, p, o) を出力するOpenIEスタイルのバックエンドに渡されます。Closed IEとは異なり、事前定義された関係インベントリは不要です。これはオープンエンドの生成に不可欠です。重要な設計制約はテキストアンカリングです。つまり、幻覚に関連する引数は、検証失敗をスパンに射影できるよう、ソース応答への文字レベルのアライメントを保持しなければなりません。

特徴的な工夫はインクリメンタルな事実構築です。1つの関係につき最大のトリプルを1つ出力するのではなく、Enokiはネストされた段階的な精緻化のシーケンスを出力します。「Enokiは中国北部で栽培されているキノコだ」という文に対し、コンテキストが(北部ではなく)中国での栽培を述べている場合、抽出は2つのグループを生成します。

  • G1: (Enoki, is, mushroom) → 含意される
  • G2: (Enoki, cultivated in, China) → 含意される;(Enoki, cultivated in, northern China) → 含意されない

サポートされていない差分——トークンスパン「northern」——がフラグを立てられ、目的語引数全体ではありません。これがアライメントモジュールなしにEnokiがサポートされた粗い事実とサポートされていない修飾語を区別する方法です。

3つの抽出バックエンドが共有の検証器とスパン射影器に接続されているEnokiパイプライン

検証。 明示的検証のすべての変種は、NLI検証器として ModernBERT-large-nli を使用します。幻覚確率は p_{\text{halluc}} = p_{\text{contradiction}} + p_{\text{neutral}} と定義されます。つまり、含意以外はすべてサポートされていないとみなされます。サポートされていないトリプルは、保持されたテキストアンカーを通じてスパンに射影されます。より粗いトリプルが含意されより細かいトリプルが含意されない精緻化ペアでは、新たに追加されたトークンがマークされます。

3つの抽出バックエンド。 Enoki-LLMは、インクリメンタルなトリプルを出力するようプロンプトされたLLMを使用します。Enoki-EncoderはEnokiQA開発分割でのEnoki-LLMアノテーションからdistillされたIGLスタイル(iterative graph labeling)のシーケンスタガーです。Enoki-Ruleは最安値のレジームに向けたルールベースのOpenIEバックエンドです。3つともすべて同じ検証器と射影コードに接続されるため、精度とコストのトレードオフは抽出器を交換することで調整できます。

Enoki-Encoderの訓練とEnokiQA

Enoki-EncoderはEnokiQA開発分割で訓練されます:1,995件の例→5,474文→36,865個のインクリメンタルトリプルで、5%が検証と早期終了のために保留されます。抽出深度(文ごとのインクリメンタルトリプル数)は開発文の95%をカバーするように設定されており、最大値は14です。トリプルアノテーションはもともとEnoki-LLMによって生成されているため、これは実質的にLLM抽出器をencoder taggerにdistillationすることです。

EnokiQA自体は、デュアル粒度の長文QAベンチマークとして公開されています:3,990件のラベル付き例(開発+テスト、それぞれ1,995件)と19,594件のラベルなし訓練例、7つの生成器モデルからの出力(分割ごとにモデルごとに285件のラベル付き)を含みます。クレームレベルの検証ラベルとスパンレベルの局在化ラベルの両方が、完全な記事のWikipedia証拠とともに提供されます。

結果

評価は、スパン局在化、エンティティ検出、文レベルの事実性という3つの粒度にわたり、暗示的検出器(ラベル/スパンを直接予測)と明示的パイプライン(分解してから検証)の両方と比較されます。主要な発見はRAGTruthにおける効率性/精度のパレートフロントです:

RAGTruthにおける精度と効率性のトレードオフ;点のサイズは文あたりのFLOPsを表す

Enoki-Encoderはフロンティア上に位置し、競合ベースラインより4〜10倍高速で動作し、マルチステージLLMパイプラインよりほぼ2桁高速でありながら、精度においても競合水準を維持しています。Enoki-LLMは同等のコストで強力なクレームレベルのシステムと競合し、細粒度のスパンおよびエンティティレベルの局在化において優位性を示します。これは、スパンアンカーを事後アライメントではなく第一級の出力として持つことの当然の帰結です。

限界と未解決の問題

評価はすべての明示的パイプラインにわたって単一のNLI検証器(ModernBERT-large-nli)を使用しており、Enokiの優位性がどの程度検証器固有のものか、あるいは表現固有のものかは不明です。Enoki-EncoderのdistillationターゲットはEnoki-LLMのインクリメンタルトリプルであるため、教師の誤り——特にどの修飾語が「差分」を構成するかに関する系統的な誤り——が伝播します。深度14はEnokiQAの文の95%をカバーしますが、長い列挙や深くネストされた文は切り捨てられます。射影スキームは、サポートされていない部分が新たに導入されたトークンにクリーンに付随することを前提としており、粗い引数の書き換えを要する絡み合った幻覚は誤帰属されます。最後に、文単位の抽出は文をまたいだ共参照を捨てており、これは談話レベルの事実性(例:代名詞駆動のクレーム)を損なう可能性が高いです。

なぜこれが重要か

Enokiは、クレームレベルとスパンレベルの幻覚検出が別々のパイプラインを必要としないことを示しています:インクリメンタルな精緻化を伴うテキストアンカー型のOpenIE表現により、両方が自然に得られ、LLM抽出器からdistillationされたencoderが4〜10倍低コストで精度の大部分を回復します。応答ごとの検証コストがボトルネックとなる本番RAGシステムにとって、これはマルチコールのLLM分解よりも魅力的なエンジニアリングポイントです。

Source: https://arxiv.org/abs/2609.00581

Hacker News Signals

Embeddingの普遍的幾何構造の活用

Source: https://arxiv.org/abs/2505.12540

本論文は「プラトニック表現仮説」を実証的に検証しています。すなわち、異なるモデルおよびモダリティによって学習されたembedding空間が、共有された幾何構造へと収束するという仮説です。著者らは、対応データや明示的なアライメント学習なしにembedding幾何のクロスモデルアライメントを研究することで、この仮説を具体的に検証可能な形に落とし込んでいます。

核心的な技術的主張は、ペアワイズ距離構造(具体的には kernel K(x,y) = \langle \phi(x), \phi(y) \rangle)が、centered kernel alignment(CKA)または mutual k-nearest-neighbor overlapで計測した場合、独立に学習されたエンコーダ間でおおよそ保存されるというものです。異なるアーキテクチャ(ResNets、ViTs、CLIP、LLMs)の大規模なembedding空間について、上位の主成分が強く相関することが示されており、複数のモデルファミリーにわたって上位10個の主成分(PC)間の相関係数は0.85を超えています。

実用的な成果はゼロショットstitchingです。対応する学習データが存在しない2つのembeddingモデル f_Af_B が与えられた場合、共有された幾何構造を活用することで、期待値として W f_A(x) \approx f_B(x) を満たす軽量な線形写像 W を学習できます。この手法は緩やかに性能が低下する性質を持ち、モデルが大規模でドメインが重複している場合、stitchingの精度は完全に教師あり学習されたadapterと比較してわずか数パーセントしか低下しません。

制限事項も現実的なものです。この普遍性は細粒度の意味レベルでは崩れ、小規模なモデルではアライメントが弱くなります。収束を駆動するメカニズム——データの重複によるものか、帰納バイアスによるものか、あるいはlossの構造によるものか——は未解明のままです。また、幾何構造が大きく乖離する可能性のある敵対的なシナリオや分布外シナリオについてもテストされていません。次トークン予測やcontrastive objectiveに対するSGDがなぜ同型な距離空間を生成するのかという理論的根拠はほぼ存在せず、本論文は理論を求める実証的観察にとどまっています。

なぜこれが重要か

ゼロショットモデルstitchingは、モジュール型AIシステムや再学習なしのクロスモーダル検索に直接的な示唆を与えます。幾何的普遍性の発見が成立するならば、adapterの設計を大幅に簡略化できます。


「次トークン予測器」はLLMに対する誤った思考モデルである

Source: https://gmcgoldr.github.io/2026/09/04/llm-next-token-predictors.html

この投稿は、LLMを次トークン予測器として捉えることはメカニズム的には正確であるが、認知的には誤解を招くと主張しています。このラベルによって実務者はモデルが内部で何を表現しているかを体系的に過小評価してしまいます。

議論の核心は統計的なものです。十分に大規模なコーパスに対してcross-entropy lossを最小化するよう学習された次トークン予測器は、完全な条件付き分布 p(x_t \mid x_{<t}) を暗黙的に表現しなければなりません。あらゆる文脈にわたってその条件付き分布が正確であるためには、モデルは談話状態、エンティティの共参照、論理的含意、および語用論的文脈を追跡するのに十分な圧縮された世界モデルを保持しなければなりません。「次トークン」という枠組みは、正確な出力を生成するために必要な内部計算ではなく、出力インターフェースに注目させてしまいます。

著者は、物理シミュレーションエンジンを「浮動小数点乗算器」と呼ぶことへの類推を示しています。支配的な演算という観点では技術的に正しいものの、表現的な構造を曖昧にしてしまうというものです。この議論はLLMが意識を持つとかAGIに近いということを主張するものではありません。より限定的な主張として、次トークンというラベルが人々に浅い統計的パターンマッチングを期待させ、汎化能力に驚かせてしまうというものです。

この投稿はエンジニアリングの実践的な指摘もしています。プロンプト戦略、fine-tuningの決定、障害モードの分析はすべて思考モデルに影響を受けます。浅い検索を期待していれば隠れた状態の不整合を探ることはないでしょうが、モデルがlossを最小化するために一貫した文脈を追跡しなければならないことを理解していれば、context window飽和やattention sinkの効果について異なる方法で計測するでしょう。

これは本質的に、mechanistic interpretabilityの文献(Elhage et al.のcircuitsの研究)や「language models are few-shot learners」という枠組みで示された議論の再陳述です。しかしこのブログ投稿はそれらをわかりやすく統合しています。コメント欄では正当な反論も示されています。世界モデルという枠組みは過大な主張になり得ること、また「p(x_t \mid x_{<t}) に対する十分統計量」は真正な世界モデルとは同義ではないということです。モデルは訓練データ上では完全な次トークン予測器であると同時に、分布外では失敗するような微妙に誤った世界モデルを表現している可能性があります。

なぜこれが重要か

思考モデルはアーキテクチャおよびプロンプトの選択を左右します。この投稿による枠組みの再設定は、loss最小化がモデルに実際に何を計算させるかと実務者の直観をより密接に一致させるものです。


GoのビルトインマップにおけるSwiss tablesの仕組み

Source: https://victoriametrics.com/blog/go-swiss-table-map/index.html

Go 1.24はランタイムのハッシュマップ実装をSwiss tableデザインに置き換えました。本記事では、データレイアウトとプローブ戦略について正確かつ機械的な解説を提供しています。

Swiss tables(元々はAbseilに由来)は128バイトのグループを平坦な配列として使用し、各グループは16スロットを保持します。各グループには16バイトのコントロールブロックがあり、各バイトはスロットの状態をエンコードします:空の場合は0x80、削除済み(トゥームストーン)の場合は0xFE、占有中の場合はハッシュの下位7ビット(h2)です。ルックアップ時にはハッシュが分割され、上位ビット(h1)が開始グループのインデックスを選択し、h2は128ビットのSIMDレジスタ全体にブロードキャストされ、単一のPCMPEQB+PMOVMSKBシーケンスによって16個のコントロールバイト全体と並列比較が行われ、1命令で候補スロットのビットマスクが得られます。

これはGoの以前のチェーンバケット設計(バケットあたり8スロット、ポインタチェーンによるオーバーフロー)と比べて大幅に高速です。旧設計では衝突時にポインタの追跡が必要でしたが、Swiss tablesはすべてを連続したキャッシュライン上に保持します。リサイズ前のロードファクターは最大約87.5%(7/8が満杯)に達することができ、旧設計の約6.5/8と比べてメモリオーバーヘッドが削減されています。

GoのSwiss table実装はGCに適応するよう設計されています:スロットメモリはコントロールバイト(ポインタではない)への書き込みバリアを回避するよう管理され、マップヘッダは並行変更時のイテレータ無効化のためのシーケンス番号を追跡します。

本記事が取り上げる微妙な点として、削除戦略はグループ内でのみトゥームストーンを使用します。占有スロットもトゥームストーンも存在しないグループはプローブチェーンを早期に終了します(「フルグループ」不変条件)。これにより、削除時に別途リサイズを行うことなく、平均プローブ長を有界に保つことができます。

制限事項:SIMDの恩恵はアーキテクチャに依存します。128ビット整数演算をサポートしないプラットフォームでは、実装はスカラー比較にフォールバックします。本記事ではGoに特有のシナリオ(インターフェースキーを持つマップ、高チャーン下でのGCプレッシャー)のベンチマークは行っておらず、旧設計の問題が最も顕在化していたのはまさにそのような場面でした。

なぜこれが重要か

ハッシュマップはGoプログラムにおいて至る所で使用されており、この変更は本番Go環境の膨大な割合のワークロードにおけるスループットとメモリ効率を直接改善します。


Asahi Linux on M3

Source: https://asahilinux.org/2026/09/m2-episode-1/

Asahi Linuxは、Apple M3ファミリーチップ(M3、M3 Pro、M3 Max)へのLinux移植作業を記録しています。この投稿はリリースアナウンスではなく、詳細なエンジニアリングレポートであり、リバースエンジニアリングおよびドライバの観点からM2とM3の差分を解説しています。

M3はいくつかのアーキテクチャ変更を導入しており、新たな対応作業が必要となりました。GPUマイクロアーキテクチャ(コードネーム Geyser)は、タイリングおよび頂点パイプラインの点でM2(Ibiza/Palma)と異なります。既存のAGXドライバは、新しいシェーダコア向けに、新たなファームウェアインターフェース処理と異なるレジスタマップを必要としました。この投稿では、macOSの呼び出しを計装してその挙動を差分比較することで、GPUファームウェアをブラックボックス方式でリバースエンジニアリングするプロセスが解説されています。

CPUのブリングアップは比較的順調でした。ARMコアのトポロジーが変更され(P-coreの数が増加し、E-coreクラスタのレイアウトが異なります)、Asahiが正しいデバイスツリーを提供すれば、Linux ARM64カーネルはACPI/DTトポロジーテーブルを通じてこれに対応します。より困難な問題はディスプレイエンジンでした。M3搭載MacBookは新しいパネル自己リフレッシュ(PSR2)実装を採用しており、これはANE(Apple Neural Engine)コプロセッサへの協調したファームウェア呼び出しを必要とします。このコプロセッサはこれまでディスプレイの電力管理に関与していませんでした。

M3のメモリサブシステムの変更(CPU、GPU、メディアエンジン間でのユニファイドメモリ帯域幅のパーティショニング)により、iommu-v2ドライバをアップデートしてアパーチャ境界を正確に記述する必要がありました。これを怠ると、負荷時にGPUからのDMAトランザクションがフォールトを引き起こしていました。

この投稿は、動作している機能とそうでない機能について技術的に明確に記述しています。accelerated GPUはデスクトップ用途(MoltenVKに依存しないMesa経由のVulkanを含む)として機能していますが、ハードウェアビデオデコードおよびNeural Engineは、執筆時点ではM3において未サポートのままです。

なぜこれが重要か

AsahiはApple Silicon上でmainline Linuxを動作させるための主要な手段であり、M3のサポートによってこれが現行のMacBookの世代にまで拡張され、リバースエンジニアリング手法の大規模な有効性が実証されます。


AnubisにWebAssemblyを実装するまでに1年かかった

Source: https://anubis.techaro.lol/blog/2026/anubis-wasm/

Anubisは、HTTPクライアントにプルーフ・オブ・ワークのチャレンジを発行するボット対策ツールです。この記事は、WebAssemblyベースのチャレンジを最初の試みから本番環境への投入まで約12ヶ月かかった経緯についての詳細な事後分析です。

核心的な技術的問題:Anubisは元々、PoWチャレンジ(SHA ベース、難易度調整可能)をプレーンなJavaScriptで実行していました。WASMへの移行の動機はパフォーマンスです——タイトな計算ループにおいて、ネイティブWASMのハッシュスループットはV8/SpiderMonkeyにおける同等のJSより3〜5倍高速であり、正規ユーザーの解答時間を短縮しながら、ボット運営者にかかるコストを高く維持できます。

最初の試みでは、GoからWASMへの単純なコンパイル(GOARCH=wasm GOOS=js)を使用しました。バイナリサイズは2.1 MBであり、コンテンツよりも前に読み込まれるHTTPチャレンジページには許容できないサイズでした。tinygoによるサイズ削減の試みはランタイムの制限に直面しました:tinygocrypto/sha256を完全にサポートしておらず、そのWASM出力はサイズこそ小さいものの(〜80 KB)、標準的なGoのセマンティクスから逸脱しており、クライアント側のWASMとサーバー側のGoによる検証との間でハッシュの微妙な不一致が生じました。

解決策は、ハッシュのコアをCで記述し、-Ozおよび--no-entryオプションを付けてEmscriptenでWASMにコンパイルし、薄いJSシムから呼び出す方法でした。最終的なWASMバイナリは〜12 KBです。この記事ではグルーレイヤーを詳細に説明しています:WASMモジュールはリニアメモリ上のチャレンジ構造体へのポインタを受け取り、ノンスを書き戻す単一の関数をエクスポートし、JSシムはEmscriptenの最小限のlibcからエクスポートされたmalloc/freeを使用してメモリの確保と解放を処理します。

二次的な問題はストリーミングインスタンス化でした:WebAssembly.instantiateStreamingはサーバーがContent-Type: application/wasmを返すことを要求しますが、いくつかのリバースプロキシがこれを除去していました。記事では必要な具体的なプロキシ設定が列挙されています。

なぜこれが重要なのか

この記事は、WASMバイナリサイズの問題とクロス言語での検証の一貫性に関する実践的なガイドであり、これらはブラウザ側の暗号デプロイメントにおいて繰り返し発生する問題です。


システム設計における2つの抽象化:隠蔽か削減か

Source: http://muratbuffalo.blogspot.com/2026/05/the-two-abstractions-of-system-design.html

分散システム研究者でex-Azure CosmosのMurat Demirbas氏は、システム設計における抽象化の分類体系を提案しています。すべての有用な抽象化は、複雑性を隠蔽する(インターフェースの背後にカプセル化し、呼び出し側がその複雑性を意識しなくて済むようにする)か、複雑性を削減する(真に排除し、システム全体を単純にする)かのどちらかに分類できるというものです。

この区別が重要な理由は、複雑性の隠蔽が抽象化の漏洩を生み出すからです。隠された複雑性は、障害・高負荷・エッジケースにおいて再び表面化します。分散トランザクションはコーディネーションの複雑性を隠蔽しますが、その複雑性はレイテンシの急増・デッドロック・部分的障害の処理という形で再び現れます。インターフェースはシンプルに見えても、システムはそうではありません。

複雑性の削減とは、問題そのものを変えることを意味します。この記事ではCRDTを例として挙げています。CRDTはロックインターフェースの背後に並行更新の難しさを隠すのではなく、データ型を可換なマージ操作を持つものに制約することで問題を削減し、コーディネーションを構造的に不要にします。複雑性は隠蔽されるのではなく、問題の定義そのものから排除されます。

この記事は、多くのシステムエンジニアリングの議論(マイクロサービス対モノリス、ORM対生SQL、マネージドクラウドサービス対セルフホスト)が、実際には特定のコンテキストにおいてどちらの抽象化タイプが適切かという議論であると主張しています。隠蔽型の抽象化は、隠された複雑性が安定しており、障害モードが十分に特性化されている場合に適しています。削減型の抽象化は、隠された複雑性が変動しやすい場合や、漏洩のコストが高い場合に望ましいとされます。

このフレームワークは粗削りではありますが、設計レビューの視点として有用です。提案された抽象化を評価する際には、それが隠蔽か削減かを問い、隠蔽が破綻した際の漏洩をシステムが許容できるかを問うことが重要です。この記事では分類体系を形式化していない(不変条件も障害モデルも定義していない)ため、規範的な価値は限定的ですが、語彙の有用な追加となっています。

なぜこれが重要か

「この抽象化は漏洩している」という一般的ながら曖昧な設計批判に対して明確な語彙を与えており、アーキテクチャレビューやAPI設計の議論に直接応用できます。


LLMを使って投稿を書くと「知的なチャック開けっ放し」になる(2025年)

Source: https://bcantrill.dtrace.org/2025/12/05/your-intellectual-fly-is-open/

Bryan Cantrillの投稿は、具体的かつ反証可能な主張を展開しています。すなわち、LLMが執筆した技術的な文章は、著者にとって社会的なコストを伴う形で検出可能なほど浅薄であり、それは恥ずかしいが自分では気づけないファッションの失態——著者本人には見えないが、知識のある読者には丸見え——に似ているというものです。

技術的な核心は「検出の論拠」にあります。Cantrillは、文体的というよりも構造的な特徴をいくつか挙げています。LLMの文章は、選択的な強調よりも網羅的な列挙に向かう傾向があり(一つが決定的であるにもかかわらず五つの考慮点を並べるなど)、その分野では実際には確立されている主張に対して過剰な留保を付け、さらに立場を明確にすることを避けた「外交的」な表現を生み出します。これらは単なるランダムな文体上の癖ではなく、幅広いカバレッジを報酬とし、反証可能な強い主張にペナルティを課す学習目的の直接的な帰結です。

より深い論点は情報内容に関するものです。ある分野の専門家が執筆した投稿には、「その専門家が何を重要と考えるか」というシグナルが含まれており、その優先順位付け自体がデータとなります。LLMは多数のソースの分布を平均化するため、暗黙の優先順位付けシグナルはノイズになってしまいます。専門家の文章を基準に調整された読者は、なぜその投稿が薄く感じられるのかをうまく言語化できなくても、そのシグナルの欠落に気づくでしょう。

Cantrillは、これが正確性に関する議論ではないことを明示しています——LLMが生成した技術的コンテンツは事実として正確でありえます。これは、専門家の判断を事実だけでなく伝播させるメカニズムとしての、著者付き技術言説の認識論的価値に関する議論です。

この投稿はHacker Newsで大きな議論を呼び、主に閾値の問題——LLMの関与がどの程度になると知的シグナルが劣化するのか——をめぐって展開されました。文法チェックにLLMを使うことと、論拠の生成に使うことは明らかに異なりますが、その間のスペクトラムはきれいに線引きできません。

なぜこれが重要なのか

技術的な成果を公開するすべての人に直接関わる話です。LLMによる執筆は倫理的な問題であるだけでなく、最も重要な評価者である専門家の読者の目に映る、評判上の問題でもあるというのがこの議論の主張です。


1024バイトでPythonインタープリタを作る

Source: https://austinhenley.com/blog/python1024.html

Austin Henleyは、x86-16アセンブリ(DOS/ブートローダースタイルの実行を対象)1024バイトで、機能的なPythonサブセットのインタープリタを実装し、バイト予算によって強いられたすべての設計上の判断をドキュメント化しています。

サポートするサブセットは狭いながらも非自明です:整数算術、変数、if/whileprint、およびクロージャなしの関数定義が含まれます。これはFizzBuzzやフィボナッチ実装といった非自明なプログラムを動作させるのに十分であり、投稿内でも実際にデモンストレーションされています。

実装戦略は、正確性のエッジケースよりもコードの密度を優先しています。字句解析器とパーサーは、実行スタックに直接出力する単一パスの再帰的下降処理に融合されており、ASTは一切生成されません。これがサイズ削減の鍵です:二パス設計(パースしてから評価)では中間表現を保存する必要があり、数百バイトを消費してしまいます。代わりに、このインタープリタは各構文要素を認識と同時に評価します。

変数は、名前の最初の文字でインデックスされた26スロットの配列に格納されます——変数名あたり1バイトです。これによりプログラムで使用できる変数名は26個に制限されますが、名前解決はハッシュルックアップではなく直接的な配列インデックスで行われます。

関数呼び出しのコールスタックはCPUのコールスタック(CALL/RET)を再利用し、引数はレジスタ経由で渡されます。これにより独立したコールフレームの実装が不要になりますが、ハードウェアスタック深度を超えた再帰のサポートがなくなり、クロージャも使用できなくなります。

算術演算はx86整数ユニットを直接使用し、式ツリーは構築されません。演算子の優先順位は、パーサーの再帰構造(項と因子の個別ルール)によって処理されており、優先順位テーブルを使わずに暗黙的に優先順位をエンコードしています。

投稿にはコンポーネント別の完全なバイト数の内訳が含まれています:字句解析器187バイト、パーサー/評価器612バイト、I/O 89バイト、初期化136バイト。この集計は、最小限のインタープリタにおいて複雑性がどこに存在するかを理解するうえで非常に有用です。

なぜこれが重要か

インタープリタの複雑性をどこまで圧縮できるかを示す具体的な存在証明であり、教育的な成果物として、また言語実装のトレードオフに関する参照点として有用です。

注目の新しいリポジトリ

DrHazemAli/enterprise-system-design

分散システム、AIインフラ、セキュリティ、信頼性、HPC、エッジコンピューティング、ミッションクリティカルなデプロイメントといった幅広い領域にまたがる本番グレードのシステムについて推論する必要があるエンジニア向けの、体系的なコースおよびリファレンスコーパスです。資料はフラットなノートの集合ではなく、モジュールの連続として構成されており、各モジュールは部分的な障害モード、トラフィックスパイク、セキュリティレビューチェックリスト、要件のドリフトといった実際の運用上の制約にもとづいてデザイン上の意思決定を行います。カバレッジは古典的な分散システムのトピック(コンセンサス、レプリケーション、パーティショニング)に加え、MLパイプラインの信頼性やエッジ/クラウドハイブリッドトポロジーといった新しい課題にも及びます。スタッフレベルのシステムデザイン面接や技術監査に備えるシニアエンジニアの体系的な自習パスとして、また机上の仮定ではなく実際の制約のもとでアーキテクチャ上の意思決定を行う際のリファレンスとして活用できます。breadth-firstのアプローチを取っているため、個々のモジュールは専門の教科書と比較して浅い内容にとどまりますが、クロスドメインの統合——たとえば信頼性エンジニアリングの原則がHPC・エッジ・クラウドの各コンテキストでどのように異なって適用されるか——が主たる価値です。コードなし、ドキュメントのみ。

Source: https://github.com/DrHazemAli/enterprise-system-design


xevrion/breakscale

ブラウザベースの分散システムシミュレーターで、ロードバランサー・キャッシュ・データベース・アプリケーションサーバーからなるトポロジーを設計し、設定可能なトラフィック負荷を与えて、障害の伝播をリアルタイムで観察できます。教育的な設計の核心は「限界点の発見」にあります。システムに負荷をかけて何かが故障すると、ビジュアライザーがボトルネックやカスケードの発生源を正確に示してくれます。内部ではキュー・レイテンシ分布・レプリケーションラグ・ノードのヘルス状態をモデル化しており、サンダリングハード・キャッシュ無効化によるカスケード障害・単一レプリカのラグといった障害モードを、実際のインフラをデプロイすることなく再現できます。シミュレーターはJavaScriptで構築されリアクティブなレンダリング層を持ちます。トポロジーは宣言的に定義され、シリアライズされたJSONとして共有することが可能です。これは、純粋に理論的なシステム設計教材と、学習目的で実際の分散インフラを稼働させる際の大きなオーバーヘッドとの間にある空白を埋めるものです。障害の原因推論に関するエンジニアへの面接や、クラウドの費用をかけずにインタラクティブなデモが必要なコース講師にとって、特に有用です。

Source: https://github.com/xevrion/breakscale


Continuum-AI-Corp/OrcaReplay

OrcaReplayは、LLMベースのエージェント実行のためのrecord-and-replayデバッガーです。エージェント実行のすべてのステップ(ツール呼び出し、モデルの入出力、中間状態、分岐判断)をキャプチャし、再現可能なトレース形式にシリアライズします。記録されたトレースからは、決定論的な再実行、異なるモデルバックエンドへの差し替え、あるいは任意のチェックポイントから実行をフォークして反事実的な実行経路を探索することができます。これは、再現が困難な非決定論的なエージェント障害のデバッグ、フル環境を再実行せずに既存のトレースに対してモデル更新をA/B比較する場合、およびモデルバージョン間でエージェントの振る舞いをリグレッションテストする場合に直接役立ちます。アーキテクチャはオブザーバー/インターセプターパターンに従っており、エージェントコード内部への計装を必要とせず、エージェントフレームワークの呼び出しをラップする形で動作します。OrcaRouterチームによって開発されており、そのルーターインフラと自然に統合されますが、フレームワーク非依存となるよう設計されています。「タイムトラベル」という表現は適切であり、チェックポイントベースのフォークは単純なログ記録と区別する技術的に重要な部分です。

Source: https://github.com/Continuum-AI-Corp/OrcaReplay


xzf-thu/VoiceMem

VoiceMemは、ストリーミング音声エージェント向けに特別に設計された永続的なメモリ層を提供します。このアーキテクチャは、著者らが「左脳」と「右脳」と呼ぶ2つのストアに分割されています。左脳は構造化された検索メカニズムを用いて事実的・エピソード的な情報(会話履歴、ユーザーの好み、述べられた事実)を扱い、右脳は独立したembeddingおよび検索パスを用いて感情的・情動的なコンテキストを格納します。この設計の動機は、音声エージェントが知覚可能なレイテンシを避けるために100ms未満の検索を必要とするという点にあり、両ストアはストリーミングアクセスを前提として設計されています。つまり、メモリの読み書きは、ブロッキングな前処理・後処理ステップとしてではなく、オーディオパイプラインと並行して行われます。完全なストリーミングアーキテクチャにより、メモリルックアップとASR/TTSパイプラインがインターリーブされます。これは、プロダクション環境の音声エージェントにとって実践的なインフラ上の課題です。応答前に同期的なretrieval-augmentedルックアップを行うナイーブなアプローチは、顕著なラグを引き起こします。デュアルストアの分割により、事実的コンテンツと感情的コンテンツに対して、それぞれ異なるretentionポリシーとembeddingモデルを個別にチューニングすることも可能となります。これは、両者の検索特性の違いを考慮すると、合理的なエンジニアリング上の判断と言えます。

Source: https://github.com/xzf-thu/VoiceMem


zorost/AI-Engineering-Lab

24週間の自己ペース型AIエンジニアリングカリキュラムで、43本のJupyter notebookとして提供され、全モジュールを通じて単一の継続的なケーススタディが展開されます。カバーする範囲はPythonの基礎から本番環境に関連するトピックまで多岐にわたります:教師あり/教師なし機械学習、大規模言語モデルAPI、retrieval-augmented generation、fine-tuningワークフロー、エージェントフレームワーク、そしてModel Context Protocolです。クラウドカバレッジはAzure OpenAI、Google Vertex AI、AWS Bedrock、Databricksを含み、提供されたscaffoldingを使用して実際のサービスに対して実行できるよう設計されています。継続的なケーススタディの設計がこのカリキュラムの際立った構造的な特徴です——モジュールごとに独立した演習を行うのではなく、同一ドメインの問題が24週間を通じて発展していくため、より高度なテクニックが導入されるにつれて初期のコンポーネント(例:基本的なretrieval index)がどのように置き換えられたり拡張されたりするかを学習者が確認できます。MITライセンスで提供され、アカウントや登録は不要、有料コンテンツもありません。notebook優先の形式により、コース全体をローカル環境またはColabで実行できます。理論重視の機械学習カリキュラムではなく、現在のLLM中心のスタックへの体系的な入門を求める、プログラミングのバックグラウンドを持つエンジニアに適しています。

Source: https://github.com/zorost/AI-Engineering-Lab


evangelosvlachos96-dotcom/booking-microservices

.NET 10上に構築されたフライト予約システムのリファレンス実装です。エンタープライズバックエンドで頻繁に組み合わせて使用されながら、単一の一貫したコードベースで実演されることがほとんどない複数のアーキテクチャパターンを組み合わせて使っています。サービスの境界はVertical Slice Architectureで整理されており、より一般的な水平レイヤー構造ではなく、各機能がリクエスト処理から永続化まで自身のフルスタックを所有します。モデリングアプローチにはDomain-Driven Designを採用し、CQRSが読み取りパスと書き込みパスを分離し、Event Sourcingが追記専用のイベントログによる耐久性のある状態管理に使われています。サービス間通信は、同期呼び出しにgRPC、非同期メッセージングにRabbitMQとWolverineを使用しています。永続化は分割されており、トランザクショナルな書き込みモデルにPostgreSQL、読み取りプロジェクションにMongoDBを使用します。.NET AspireはローカルオーケストレーションとObservabilityの配線を担います。このリポジトリの価値は、現実的な制約のもとでこれらのパターンがどのように組み合わさるかを確認できる点にあります。たとえば、集約の境界がEvent Sourcingとどのように相互作用するか、あるいはWolverineのOutboxパターンがAt-least-once配信保証をどのように処理するかといった点です。プロダクションシステムではありませんが、構造的なテンプレートとして活用できる十分な詳細さを備えています。

Source: https://github.com/evangelosvlachos96-dotcom/booking-microservices


pierrenade/short-video-generator-AI

YouTube URLを受け取り、TikTok/Reels/Shortsに適した短尺クリップを生成する自動化パイプラインです。パイプラインの各ステージは、ハイライト検出(ソース動画から最もエンゲージメントの高いセグメントを特定)、字幕生成とburn-in、ターゲット言語への翻訳、および合成ボイスオーバーの合成から構成されています。各ステージは独立して設定可能です。技術的に最も興味深いコンポーネントはハイライト検出であり、単純なヒューリスティックではなく、音声エネルギー、シーン変化検出、およびオプションでトランスクリプトベースの顕著性スコアリングを組み合わせてセグメントをランク付けします。字幕パイプラインはWhisperベースの文字起こしバックエンドを使用しています。ボイスオーバー合成には、元話者の声をクローンするか、ターゲットボイスに置き換えることができるTTSモデルを使用しています。本システムは完全にローカルかつオープンソースであり、コア機能において有料のAPIコールを必要としない点がSaaSの代替サービスとの差別化要因となっています。Pythonで構築され、映像処理バックエンドにはFFmpegを使用しています。長尺コンテンツを1分あたりのAPIコストなしで大規模に再利用する必要があるコンテンツパイプラインに有用です。

Source: https://github.com/pierrenade/short-video-generator-AI


hkqr/my-free-code

Claude Codeや類似のコーディングエージェント(AnthropicまたはOpenAI APIサーフェス経由で通信するもの)を対象としたオープンソースのAPIゲートウェイです。単一のエンドポイントの背後にモデルルーティング、マルチプロバイダーフォールバック、およびローカルモデルサポートを追加する透過的なプロキシとして機能し、エージェントクライアント側のコード変更は一切不要です。ルーティングロジックは、設定可能なルール(モデル名エイリアス、負荷、可用性など)に基づいてリクエストをディスパッチし、Anthropic、OpenAI、およびOllama互換インターフェース経由でローカルサービングされたモデルを含む各プロバイダーへ振り分けます。ストリーミングはSSEパススルーにより完全にサポートされています。ツールコールおよびreasoning/thinkingブロックの処理は、可能な範囲で各プロバイダー間で正規化されています。フォールバックチェーンにより、レート制限やエラーレスポンス発生時にセカンダリプロバイダーへの自動リトライが可能です。主なユースケースは、エージェント自体を変更することなく、Claude Codeや類似のエージェントをクラウドとローカルモデルの組み合わせに対して実行することであり、コスト管理、レート制限の回避、またはオフライン対応の開発環境に有用です。最小限の依存関係を持つ単一サービスアーキテクチャの軽量HTTPプロキシとして実装されています。

Source: https://github.com/hkqr/my-free-code