デイリーAIダイジェスト — 2026-07-21
arXiv ハイライト
意味空間の幾何学:Transformerアーキテクチャのための連続幾何学的フレームワーク
問題設定とフレーミング
本論文は、離散的なTransformer計算に対する連続幾何学的代理モデルを構築します。具体的には、アーキテクチャを、意味的ファイバーバンドル \mathcal{E} = \mathcal{M} \times \mathbb{R}^d(\mathcal{M} \cong [0,\infty) は系列のベース多様体)上の近接する積分微分方程式(IDE)の厳密な数値積分器として扱います。本論文の目的は、Transformerが物理的なシステムであると主張することではなく、連続的な視点が通常は数値的なアーティファクトとして片付けられる現象に対して定量的な予測をもたらすことを示すことにあります。具体的には、RMSNormの \epsilon 依存性、表現のドリフト、アブレーション下でのノルムの爆発、RoPEのエイリアシング、コンテキスト長の崩壊、SGDの非平衡的な性質などが対象です。方法論的な立場は後退誤差解析(Backward Error Analysis)であり、離散積分器のマクロな可観測量を分類するリーブラケット・渦度2形式・エントロピー圧力という主要な生成子を持つ修正方程式を同定します。
方法:変換辞書
各コアモジュールが微分幾何学・測度論のオブジェクトに対応付けられています:
- トークンの位置は境界を持つ1次元多様体上の座標となり、コンテキストウィンドウは経験的なRadon計数測度 \eta_\Lambda = \sum_{\mu_i \in \Lambda} \delta_{\mu_i} のサポートとなります。
- RMSNormの \epsilon は零切断における接空間の特異点を制御するトポロジカルな軟化子であり、\|D\mathcal{F}\|_{\mathrm{op}} \propto \epsilon^{-1/2} を誘導すると予測されます。
- RoPEは、Whitney和 E = E_{\mathrm{int}} \oplus E_{\mathrm{matter}} における相互作用サブバンドル E_{\mathrm{int}} 上の共変定数なアルモスト複素構造 J を保存する唯一の平坦ユニタリ接続 \nabla^{\mathrm{RoPE}} です。attention は正則流であり、FFNは E_{\mathrm{matter}} 上の反正則対称性の破れです。
- Softmax attentionは、Markov質量制約 \int w = 1 の下、局所自由エネルギー \mathcal{F}_\mu[\omega] = \int_{\Lambda \cap [0,\mu]} [-w \mathcal{E} + \beta^{-1} w \ln w]\, d\eta_\Lambda から変分的に導出されます。ラグランジュ乗数はヘルムホルツ自由エネルギーそのものであり、分配関数 \mathcal{Z}_\mu を生成し、attentionをSchrödingerブリッジ/エントロピー最適輸送カーネルとして同定します。
- Weight decayは非コンパクトな内部ゲージ対称性の破れとして再定式化されます。QK不変性 W_Q \mapsto c W_Q、W_K \mapsto c^{-1} W_K はカーネルを不変に保ちますが、Frobeniusペナルティ \tfrac{\lambda}{2}(\|cW_Q\|^2 + \|c^{-1}W_K\|^2) は c \to 0, \infty で発散し、サブレベル集合を強制して有界な非平衡定常状態(NESS)を実現します。
- SGDは、異方性ノイズを持つパラメータ多様体 \mathcal{W} = \bigoplus_l \mathrm{End}(E_l) 上のItô拡散として扱われます。一般に詳細釣り合い条件を破り、非ゼロの循環を持つNESSをもたらします。
実験結果
Qwen3-0.6B、LLaMA-3.1-8B、Gemma-3-1B、GPT-2、Mistral(124M〜8Bパラメータ)を対象とした6部構成の反証実験が行われています。3つのテストが前面に出されています。
円錐特異点スケーリング。 原点を分離するために入力ノルム \|\Psi\|=10^{-10} を設定し、\epsilon を13桁(10^{-2} から 10^{-15}、対数等間隔30点)にわたってスイープし、層のヤコビアンの最大特異値を torch.autograd.functional.jacobian + float64での完全SVDにより厳密に計算し、10個のプローブ方向で平均を取ります。

サンプリングした5つのQwen3層はすべて傾き \alpha = -0.5000、R^2 = 1.000000 を示し、予測された \sigma_{\max} = C_\ell \epsilon^{-1/2} に機械精度で一致しています。層間の平行な曲線は、変化するのは前因子 C_\ell(層固有の重み幾何学)のみであり、指数はアーキテクチャに固有であることを示しています。
Lie–Trotter ねじれ干渉計。 非可換なattention \mathcal{T} とFFN \mathcal{R} に対して、演算子分割はステップサイズの主要オーダーにおいて交換子 [\mathcal{T}, \mathcal{R}]\Psi に整列した決定論的な残差ドリフト \delta を予測します。

両モデルとも 1/\sqrt{d} 等方ランダムベースラインに対して系統的な正の整合を示しており、層の摂動下での表現ドリフトが確率的なノイズではなく、非可換なベクトル場によって予測される交換子であることを確認しています。

整合は中間ネットワーク(Qwen3 L12: 0.879、GPT-2 L9: 0.933)でピークに達し、出力層(Qwen3 L27: 0.112、GPT-2 L11: -0.188)で劣化します。これは、表現がタスク固有になると高次(主要でないTrotter項)が支配的になることと一致しています。
追加の確認。 対称アブレーション(VI.3)では、学習済みネットワークの層ヤコビアンの反対称成分を除去すると順伝播のノルム安定性が破綻するが、対称制約下でスクラッチから再学習すると安定な盆地が回復されることが示されており、これはアーキテクチャ上の必然ではなく構成上の必然であることがわかります。特徴次元 k=2 のマイクロtransformerはRoPEトーラス上でポアンカレ再帰を示し、k のスケーリングにより予測された \mathcal{O}(1/\sqrt{k}) の速度で再帰が抑制され、本番次元での漸近的空間エルゴード仮説を正当化します。コンテキストウィンドウの劣化は、エントロピー的なバルク圧力が \partial\mathcal{M} = \{0\} のDirichlet境界を圧倒するIR相転移として特徴付けられ、有効トークン数 N_{\mathrm{eff}} \ll N であるために自然言語では生き残ります。最後に、パラメータの軌跡は 2\times 2 条件にわたって不可逆なNESSの渦(非ゼロの循環)を示します。
限界と未解決問題
このフレームワークは、剛性なガリレイ背景上の古典的な格子場の理論として明示的に位置付けられています。接続とベース計量は逆作用しないため、微分同相不変性はありません。1次元光線上の「経路モノドロミー」に関する記述はトポロジカルに自明です(\mathcal{M} 上では全ての2形式が消えます)。著者らはこれを認めています。したがって予測的な内容は、(i)アーキテクチャによって決まる機械定数を持つスケーリング則、および(ii)ドリフトと安定性の主要オーダー構造に集中しており、lossの値や汎化誤差の上界は導出されません。ねじれ整合は出力層で崩壊しており、主要オーダーのTrotter解析がそこでは不十分であることを示しています。SchrödingerブリッジとしてのAttentionは変分的な再導出として提示されており、新たなアルゴリズム的処方箋としてではありません。これが非自明な学習や推論時の介入(\betaアニーリングスケジュール、エントロピー最適輸送正則化attentionなど)をもたらすかどうかは未検証です。NESSと渦の主張は軌跡循環の測定に依存しており、オプティマイザの選択(Adam vs SGD、モメンタム、ウォームアップ)に対するロバスト性は系統的に分析されていません。
重要性
安定性定数(\epsilon)、表現のドリフト、コンテキストウィンドウの崩壊を、明確に定義された連続代理モデルの決定論的なマクロ可観測量として再定式化することで、R^2=1.000 における \epsilon^{-1/2} 則が最もクリーンな例として示すように、事後的な経験的フィットではなく鋭い反証可能な予測が得られます。フレームワークの主要オーダーの生成子がこれらの現象を真に分類するならば、正規化定数の選択、層ごとの交換子構造の診断、そしてRoPEエイリアシングやコンテキスト劣化がいつ現れるべきかの推論に対して原理的な基盤を提供します。
Source: https://arxiv.org/abs/2607.17146
TimeLens2: マルチモーダルLLMによる汎用ビデオ時間的グラウンディング
問題設定
ビデオMLLMはイベントを記述することはできますが、それを局所化することはほとんどありません。時間的グラウンディング(自然言語クエリを、それを支持するビデオの区間にマッピングすること)は、本質的に集合値予測問題です。答え \mathcal{Y} = \{[s_k, e_k]\}_{k=1}^K は可変の濃度 K を持ち、対象区間は断片化されていたり、任意の順序で並んでいたり、数秒から1時間以上にわたるビデオに広がることがあります。既存のパイプラインはこの問題を2つの点で誤って扱っています。第一に、長尺ビデオのラベルは、注意散漫要素が増えるにつれて精度が低下するシングルパスのアノテーターによって生成されます。第二に、RL報酬は崩壊するか(temporal IoUは重複しない予測に対してゼロとなるため、惜しい外れとかけ離れた誤りが区別できない)、あるいは予測とターゲットの濃度が異なる場合や同じ証拠が2つの候補出力で異なる形に断片化されている場合に不安定となるHungarian方式のセグメントマッチングを必要とします。
TimeLens2はデータと最適化の両面に対処し、時間的証拠を一貫して区間集合として扱います。

データ: TimeLens2-93K
このコーパスは23,793本のビデオと93,232件のグラウンディングインスタンスを含み、そのうち12,091件が複数の支持区間を持ちます。ビデオは1分未満から1時間超までの5つの時間長ビンに層化されており、探索範囲と注意散漫要素の密度は、サンプリングの副産物ではなく制御された設計軸となっています。
構築パイプラインは、候補構築(ステップ1〜3)とラベル決定(ステップ4〜6)に分解されます。

ステップ1〜3: ビデオ全体の階層的タイムスタンプ付きキャプションにより、宣言的クエリと粗い単一または複数スパンの提案が生成されます。クエリは完全なコンテキストで作成されるため、モデルは単にアライメントするのではなく、探索することを学習します。ステップ4〜6: 独立したエージェントが各提案を提案周辺の短いクリップから再局所化し、エージェント間の時間的コンセンサスが不安定な区間を排除し、意味的検証器が不一致なものを排除し、局所境界リファイナーが残存した区間のみを鋭化します。この段階的分解により、単一のアノテーターが長尺ビデオ内で証拠を同時に発見・境界設定しなければならないという標準的な失敗モードを回避しています。
報酬: 時間的Wasserstein
最適化における核心的な貢献は、セグメントマッチングなしに区間集合に直接作用する時間的Wasserstein報酬 R_{\mathrm{TW}} です。予測と対象の区間集合が与えられたとき、各集合内の重複する区間をマージし、マージされたサポート上に一様1次元分布 p_{\hat{\mathcal{Y}}} と p_{\mathcal{Y}} を定義します。報酬は厳密な1次元Wasserstein-1距離の単調変換です。
W_1(p_{\hat{\mathcal{Y}}}, p_{\mathcal{Y}}) = \int_0^T |F_{\hat{\mathcal{Y}}}(t) - F_{\mathcal{Y}}(t)|\, dt,
これは2つのステップCDFの差分に対する閉形式の積分に帰着し、計算量は O(n \log n) です。機械的に重要な2つの性質があります。
- 重複しない予測でも時間的近接性に比例した段階的フィードバックが得られるため、tIoUが恒等的にゼロとなる領域でもgradientが存在します。
- 同一の和集合の等価な断片化は等しい報酬をもたらし、異なる濃度に対して明示的なマッチングが不要です。\hat{K} \neq K の予測は、置換ではなく密度間の輸送コストによってスコアリングされます。

この図は2つの典型的な失敗モードを示しています。(a) tIoUは惜しい外れと遠い誤りの両方をゼロにしますが、R_{\mathrm{TW}} はそれらを区別します。(b) tIoUは1つのターゲットと重複する単一モーメント予測を好みますが、R_{\mathrm{TW}} は2番目のターゲットモーメントを部分的に回復する予測を好みます。tIoUは精密な重複フィードバックのための補完的な項として保持されるため、組み合わせた報酬は R = \alpha R_{\mathrm{TW}} + (1-\alpha) R_{\mathrm{tIoU}} となります。R_{\mathrm{TW}} が密な長距離シグナルを提供し、R_{\mathrm{tIoU}} が予測が重複したときの鋭さを提供します。
結果
評価は、短尺および長尺ビデオ、単一および複数スパン、宣言的および疑問的クエリ、三人称および自己中心視点をカバーする7つのベンチマークにわたります。具体的には、Charades-STA、ActivityNet Captions、QVHighlightsのTimeLens-Bench再アノテーション、VUE-TRおよびVUE-TR-V2のvisionサブセット、MomentSeekerのテキストのみクエリサブセット、およびEgo4D-NLQ validationです。図1のmIoUレーダーチャートは、TimeLens2-2Bが全7軸で支配的であることを示しており、特に R_{\mathrm{TW}} シグナルが最も有益であると期待される長尺ビデオおよびマルチスパン軸(VUE-TR、VUE-TR-V2、QVHighlights再アノテーション)で大幅な改善が見られます。これらの領域は、tIoUのみのベースラインがzero-gradientプラトーの問題を抱えている箇所です。概要レベルの主要な知見は、2Bパラメータの汎用モデルがこの評価スイートにわたって専門モデルと同等以上の性能を示すことです。提供された抜粋は完全な数値テーブルの前で切断されています。
制限と未解決の問題
W_1 の定式化は区間を時間上の測度として扱い、あるマス単位がどの区間に属するかに不変であり、これは等価な断片化に対して望ましい挙動ですが、因果的または手続き的クエリにとって重要な順序情報を破棄します。また、この報酬は、マスを移動させない限り、偽の短い区間をネイティブにペナルティ化しません。tIoUとの組み合わせはこれを部分的にしか解決しません。データパイプラインは初期の階層的キャプショナーからのキャプション品質に依存しており、エージェント間コンセンサスの閾値は再現率とラベルノイズのトレードオフを調整するチューニング可能なパラメータです。最後に、評価は2Bスケールで行われており、SFT単独がより強力になる大規模スケールでも報酬の優位性が持続するかどうかは未検証です。
重要性
区間集合予測は、グラウンデッドビデオQAおよび検索の自然な定式化ですが、報酬設計が遅れており、システムを単一スパンの仮定または脆弱なマッチングに追い込んでいました。閉形式でマッチングフリーな1次元Wasserstein報酬は、この空間でRLに適切に振る舞う目的関数を与え、局所的な鋭さのためのtIoUとすっきりと組み合わせられます。これは、あらゆる集合値1次元局所化タスクに転用できるテンプレートとなり得ます。
Source: https://arxiv.org/abs/2607.17423
DeepSearch-World: 検証可能な環境におけるDeep Searchエージェントの自己蒸留
問題
Webサーチエージェントを自身の軌跡から反復的に改善するよう訓練する際、二つの失敗モードがボトルネックとなっています。教師による蒸留済みトレース(例:GPT-4クラスのモデルから収集した軌跡)を用いたsupervised fine-tuningは、学生モデルが教師の行動分布に上限を設けられてしまう上、更新コストも高くなります。エンドツーエンドのタスク成功に対するスパースな報酬によるRLは、単一エピソードで20回以上のツール呼び出しを伴うような長期的なブラウジングにおいては信号が弱すぎます。さらに、ライブWebの非決定性によって報酬のランドスケープが汚染されます。具体的には、ページが変化し、検索ランキングがドリフトし、レート制限がロールアウトを破損させます。不足しているのは、軌跡が再現可能で、ツールの出力が時間を超えて安定しており、成功を決定論的に検証できる環境です。そうした環境があってはじめて、自己生成データをフィルタリングしてトレーニング信号として再利用することができます。
DeepSearch-Worldはまさにそのような環境であり、DeepSearch-Evolveはその上に構築された自己蒸留ループです。
DeepSearch-World:環境
DeepSearch-Worldは決定論的かつ検証可能なサーチサンドボックスです。searchとpage-readという二つのツールを公開しており、これらはWebコーパスのフリーズされたスナップショットによって支えられているため、特定のクエリは毎回のロールアウトで同一のランク付き結果を返し、特定のURLは毎回同一のコンテンツを返します。この決定論性こそが、報酬信号を自己蒸留に十分なほど安定させる要因です。エージェントの軌跡を再生し、その中間ステップを再スコアリングすることが可能になります。
タスクは、知識グラフ上のエンティティレベルのランダムウォークによって生成された42万件のマルチホップQA問題です。長さkのランダムウォークはエンティティの連鎖e_0 \to e_1 \to \cdots \to e_kを生成し、このチェーンを連続的なsearch-and-read操作によってたどることを要求する質問が合成されます。正解はターミナルエンティティまたはその属性です。ウォークが明示的であるため、環境はどのページを訪問しなければならないかを把握しており、最終回答の照合だけでなく、より細粒度の軌跡レベルの検証が可能です。
著者らは、長期エージェントにとって重要な三つの認知的行動を引き出すように環境を明示的に設計しています。
- 進捗確認(Progress verification):エージェントが処理を継続する前に、中間的な検索がサブゴールを満たすかどうかを確認する。
- グラウンデッドリフレクション(Grounded reflection):エージェントが次のアクションを決定する際に、条件付けているパッセージを引用する。
- 失敗回復(Failure recovery):行き詰まった検索の後、エージェントがハルシネーションを起こすのではなく、バックトラックしてクエリを書き直す。
DeepSearch-Evolve:自己蒸留ループ
DeepSearch-Evolveは四つのステージにわたる反復ループです。
- 軌跡生成(Trajectory generation)。 現在のポリシー\pi_\thetaが42万件のプールからサンプリングされたサブセット上で、タスクごとにN本の軌跡をロールアウトします。各軌跡は(思考、ツール呼び出し、観察)のトリプルの列であり、回答で終わります。
- フィルタリング(Filtering)。 軌跡は、(a) 正解エンティティに対する最終回答の正確性と、(b) 構造的なチェック(エージェントが必要な中間エンティティを訪問したか、ツール呼び出しはパースできたか、リフレクションは観察されたテキストに基づいていたか)によってスコアリングされます。両方を通過した軌跡のみが保持されます。
- データミキシング(Data mixing)。 保持された軌跡は、前ラウンドのデータの小さなアンカーと混合され、タスクの難易度(マルチホップの深さ)によって再バランスされます。これにより、簡単な2ホップタスクへのモード崩壊を防ぎ、より難しいチェーンをトレーニングミックスに保持します。
- Fine-tuning。 混合コーパスを用いて\pi_\thetaをSFTし、\pi_{\theta'}を生成します。これが次のイテレーションのジェネレータとなります。
ループはクローズします。外部の教師へのクエリは行われないため、上限はベースモデルが難しいタスクで時折成功する能力と、環境がその成功を確実に検証する能力によって定められます。トレーニングの目的関数は、フィルタリングされた軌跡に対する標準的な次トークンのクロスエントロピーです。
\mathcal{L}(\theta) = -\mathbb{E}_{\tau \sim \mathcal{D}_{\text{filtered}}} \sum_{t} \log \pi_\theta(a_t \mid s_{<t}),
ここでa_tは自然言語の思考とツール呼び出しトークンの両方にわたります。
結果
DeepSearch-World-9Bは、教師の軌跡を用いずに9Bのベースモデルから純粋に自己蒸留によって訓練され、以下の結果を達成しました。
- BrowseCompで31.2%、
- GAIAで61.5%、
- HotpotQAで93.4%。
これらの数値は、より高性能な独自モデルからの蒸留に依存するオープンソースエージェントと競争力のある水準です。9Bエージェントとして93.4%のHotpotQAは実質的に飽和しており、検証可能なコーパス上でのマルチホップQAがトレーニング分布と密接に一致していることを反映しています。31.2%というBrowseCompの結果はより興味深いデータポイントです。BrowseCompはフロンティアのブラウジングエージェントにとっても難しいように設計されており、教師蒸留なしに31.2%に達したことは、フィルタリングされた自己生成軌跡が、より強力なモデルの模倣だけでなく、自明でない推論信号を持っていることを示唆しています。61.5%のGAIAは、異なるツールサーフェスを持つタスクへとトレーニング環境外でも行動が転移することを示しています。
限界と未解決の問題
環境はフリーズされたスナップショットであるため、エージェントはライブWebの病理的状況(古いキャッシュ、悪意あるページ、時間的に矛盾するソース、動的なUI)を処理する必要がありません。エンティティのランダムウォークによるタスク構築は、選言的推論、取得した値に対する算術、矛盾するソースの相互参照を必要とするタスクよりも、チェーンたどりへと難易度分布を偏らせます。フィルタリング基準は正解エンティティチェーンの把握に依存しており、ウォークが合成的であるがゆえに安価ですが、有機的なタスクへの拡張には別途検証器が必要になります。最後に、本論文はSFTのみの自己蒸留を報告しており、同一のフィルタリングされた軌跡に対するRLバリアント(例:DPOやGRPO)との比較は行っていません。そのような比較があれば、利得が環境の検証可能性からくるのかトレーニングアルゴリズムからくるのかが明確になるでしょう。
この研究が重要な理由
検証可能で決定論的な環境は、自己改善エージェントに欠けていた基盤になりつつあります。軌跡をオフラインで再生してスコアリングできるようになれば、SFT対RLの議論はフィルタリング問題へと収束します。DeepSearch-Worldは、9Bモデルが教師の軌跡なしにBrowseCompと競争力のある数値に達することができることを示しており、エージェントの能力がモデルサイズと少なくとも同程度に環境の品質に依存するという証拠となっています。
Source: https://arxiv.org/abs/2607.07820
Apple-π: 法則に基づく物理的知性に向けたビデオを用いた思考のベンチマーキング
問題設定
動画生成モデルは暗黙的な物理的事前知識を持つ世界モデルとして位置づけられることが増えていますが、既存のベンチマーク(VideoPhy、PhyGenBenchなど)は生成されたクリップの終端における妥当性のみを評価します。モデルは保存則に違反しながらも尤もらしいトラジェクトリを生成したり、物理に基づく運動推論ではなく訓練データのパターンマッチングによって正しい結果に到達したりすることがあります。Apple-πはより鋭い問いを立てます。すなわち、生成のトレースが単に尤もらしいフレームで終わるだけでなく、状態の知覚・支配法則の選択・動力学の導出という忠実な物理推論の連鎖に対応しているかどうかを問います。

手法
Apple-πは三つの要素から構成されます:Orchardデータセット、三段階プロトコル、そしてハイブリッド評価スイートです。
Orchard. 400件のケースが十の標準的な古典力学タスクにわたって構成されており、三つの単一法則の柱——万有引力・運動量保存則・ニュートンの第一法則——と複数法則の複合ブランチに整理されています。データは三つのソースから取得されます:客観的指標に必要な真値パラメータとピクセル精度のトラジェクトリを提供するIsaac Simレンダリング243件、自己録画した実験室ビデオ121件、厳選されたインターネットクリップ36件です。意味的な事前知識を制御し、マスク・重心・接触面を一貫してアノテーションできるようにするため、物体は四種類の基本立体(球・立方体・円柱・円錐)に限定されています。

プロトコル. 各ケースはインフォグラフィックでアノテーションされた最初のフレーム(変数・ベクトル・参照軸が画像上に描画されたもの)から始まります。連続フレームのプロンプトにより、科学的推論を分解する五つのサブトラックが引き出されます:
- Perception-Text (P-T):アノテーションされたフレームから数値量を読み取る。
- Perception-Graphic (P-G):物体のセグメンテーション・局所化を行う。
- Formulation-Text (F-T):支配法則を選択する。
- Formulation-Graphic (F-G):目標状態(最終フレームの成果物)を予測する。
- Deduction (Ded.):予測された動力学を実現する完全な動画シーケンスを生成する。
生成された動画はモデルの可視的な推論トレースとして扱われるため、サブトラックレベルでの採点により、単一の妥当性スコアに集約するのではなく失敗を局所化できます。

評価スイート. MLLMベースの主観的採点(ジャッジとしてGemini 3 Flash)はすべてのサブトラックをカバーします。シミュレーターの真値に対するトラジェクトリ誤差などの物理法則に基づく客観的指標は、シミュレーション分割上のDeductionとF-Gを担保します。完全な動画を出力しない統合的な理解・生成モデルに対しては、同じフレームレベルの基準を用いて、所定のタイムスタンプにおける疎なキーフレームでDeductionを評価します。
各モデルは 400 \times 5 \times 3 = 6000 件の応答(五つのサブトラック、三回のロールアウト)で実行されます。
結果
11のモデルがベンチマーク評価されています:動画生成モデル5つ(Wan2.2、HunyuanVideo-1.5、VBVR-Wan2.2、Seedance 2.0、Veo 3.1)と統合モデル6つ(BAGEL、OmniGen2、SenseNova-U1-8B-MoT(Thinkあり・なし)、GPT Image 2、Nano Banana 2)です。スコアは [0,1] の範囲です。
主要な知見:動画生成モデルは平均 0.473(Seedance 2.0)を超えるものがない一方で、二つの統合画像モデルが優位に立ちます——GPT Image 2が 0.704、Nano Banana 2が 0.699 です。この差はサブトラック間で一様ではなく、Formulation-TextとDeductionに集中しています:
- Perception-Text:複数の動画モデルがすでに良好な性能を示します(VBVR-Wan2.2 0.923、Nano Banana 2 0.934、GPT Image 2 0.921)。アノテーションされた数値の読み取りはほぼ解決済みです。
- Formulation-Text(法則選択):純粋な動画生成モデルでは壊滅的な失敗が見られます——Wan2.2 0.009、VBVR-Wan2.2 0.001、HunyuanVideo-1.5 0.027——に対し、GPT Image 2は 0.824、Nano Banana 2は 0.841 です。動画のみのパイプラインは、どの法則が適用されるかをほぼ言語化できません。
- Deduction:最良のモデルでも依然として弱いです。Seedance 2.0が動画生成モデルの中で 0.315 とトップですが、GPT Image 2とNano Banana 2は上流段階が強力にもかかわらず 0.406 と 0.405 にとどまります。法則に整合した動力学の生成が依然として制約となっています。
- 柱ごと:ニュートンの第一法則が最も簡単です(等速・静止運動;例えばSeedance 0.495、GPT Image 2 0.742)。一方、複数法則の複合は一様に最も困難です(GPT Image 2は 0.618、Seedanceは 0.389 まで低下)。
- ソースごと:シミュレーション分割のスコアは実世界を上回ります(例:Seedance 0.487 対 0.459;Nano Banana 2 0.743 対 0.656)。これは真の汎化ではなく、ドメインシフトとパラメータのクリーンさによる効果と整合しています。
二つの副次的な観察があります。第一に、SenseNova-U1-8B-MoTとその”-Think”バリアントはそれぞれ 0.362 対 0.359 というスコアであり——明示的な推論トークンはここでは測定可能な改善をもたらしておらず、chain-of-thoughtが法則に基づく視覚的動力学に転移しないことを示唆しています。第二に、VBVR-Wan2.2はP-TとF-Tの不一致を示しています(0.923 の知覚、0.001 の定式化):シーンを読み取ることは物理への理解を意味しません。
限界と未解決の問題
Orchardは四種類の基本立体と三つの古典法則およびその複合に限定されており、摩擦が支配的な系・変形可能な物体・流体・熱力学的な状況は含まれておらず、物体形状の交絡因子は最小化されているものの研究対象とはなっていません。MLLMジャッジ(Gemini 3 Flash)は採点の事前分布を導入しており、特にF-Tにおいて純粋な動画生成モデルよりもテキスト能力の高い統合モデルを優遇する可能性があります。Deductionにおいて統合モデルを疎なキーフレームで評価することは、完全な動画でのDeductionと厳密には比較できません。Nano Banana 2(0.405)とSeedance(0.315)の差は、この非対称性を部分的に反映している可能性があります。さらに、客観的な物理指標はシミュレーション部分集合のみに適用されているため、実世界の数値は主観的採点により大きく依存しています。
重要性
Apple-πは物理的評価を「クリップが正しく見えるか」から「モデルが知覚→定式化→導出を通じて推論したか」へと再定式化します。その結果として得られる段階分解されたスコアは、現在の動画生成モデルが物理法則の選択と動力学の生成において主に失敗しており、知覚においては失敗していないことを示しています。これは、物理的世界モデリングの進展が動画の事前知識をスケールアップするだけでなく、シンボリック・法則レベルの推論とピクセルレベルのロールアウトのより緊密な結合から生まれることを示唆しています。
Source: https://arxiv.org/abs/2607.16401
DiffGI: 高忠実度薄殻3D生成のための微分可能ジオメトリイメージ
問題
ボリューメトリック3D生成モデル(SDF/占有グリッド、TRELLISスタイルのlatent)は閉じたトポロジーを前提とし、衣服・カラー・裾などの薄殻オブジェクトを膨張させてしまいます。ジオメトリイメージアプローチは、UVチャートを通じてメッシュを2Dグリッドに展開することでこの問題を回避しますが、既存のパイプライン(Omages、GarmageNet)は有効なチャートピクセルを示すために二値占有マップを使用しています。二値境界には二つの問題が連動して生じます:(i) 1024×1024のオーサリング解像度から256×256のlatent学習解像度にダウンサンプリングした際、サブピクセルの境界位置が失われ、裾や開放エッジに沿った階段状のエイリアシングが発生する、(ii) マーチングスクエア方式のテッセレーションによるメッシュ復元が微分不可能であるため、3D空間のlossがネットワークへbackpropagateできない。

手法
DiffGIは二値占有チャンネルを、UVプレーン上で計算された2D切り捨て符号付き距離関数(TSDF)に置き換え、微分可能マーチングスクエア(DMS)エクストラクタと組み合わせることでエンドツーエンドの3D教師あり学習を可能にします。
メッシュ → DiffGI変換(オフライン)。 UVチャートはチャート間パディングを設けたAABBアルゴリズムで配置され、全体最適化されたフィル比率が用いられます。メッシュ表面は1024×1024グリッドに重心座標でサンプリングされ、3チャンネルの位置マップ P \in \mathbb{R}^{1024\times1024\times3} が生成されます。境界ピクセルは境界劣化を防ぐために外側へ拡張されます。P とは独立に、配置されたチャートが二値マスクにラスタライズされ、2DユークリッドDTにより各ピクセルに最近傍チャート輪郭までの符号付きピクセル距離(内側が正、外側が負)が割り当てられ、\pm 15 pxでクランプされます。重要なのは、有効な3D位置を持たない背景ピクセルにも明確な負のTSDF値が与えられることです。4チャンネルテンソル (P, \text{TSDF}) \in \mathbb{R}^{1024\times1024\times4} は双線形ダウンサンプリングにより 256\times256\times4 に縮小されます。TSDFは境界付近で滑らかに変化するため、ダウンサンプリングによって零水準集合が粗いピクセルグリッドにスナップされることなく連続的にシフトします。
DiffGI-VAE + DMS。 Stable Diffusion 1.5で初期化されたVAEが256×256×4のマップをコンパクトなlatentにエンコードし、再構成します。メッシュ化では、TSDFチャンネルの零水準集合からマーチングスクエアにより三角形セットを復元しますが、頂点座標は隣接するピクセルのTSDF値の間の解析的な線形補間によって求められます:
v = p_a + \frac{\phi_a}{\phi_a - \phi_b}(p_b - p_a),
これはほぼ至るところで \phi_{a,b} に関して微分可能です。3D頂点位置は再構成された位置マップから読み取られます。曖昧なサドル配置(MSケース6および9)は二つの分離したパッチとして決定論的に解決されます。256×256でのチャート間パディングにより、セル内の橋状配置はまれであり、それらのケースでも頂点座標は \phi に関して連続を保ちます。
Loss。 TSDFと位置マップに対するピクセル空間のL1/L2 lossに加え、抽出されたメッシュ上で計算される3D法線整合性loss \mathcal{L}_{\text{Normal}} が組み合わされます。\mathcal{L}_{\text{Normal}} がDMSの微分可能性によって初めて有効なgradientを生成できるため、3D表面ジオメトリからVAEの重みへのループが閉じられます。

結果
表現性の向上(アブレーション、GarmageSet)。 lossを固定したまま占有マップをTSDFに交換するだけで、3D lossを加える前の段階でChamfer距離が 1.503\times10^{-3} から 0.595\times10^{-3} へと2倍以上低下します。DMSが微分可能であるために初めて適用可能な \mathcal{L}_{\text{Normal}} を有効にすると、CDはさらに 0.461\times10^{-3} まで低減し、法線整合性は0.921から0.961に向上します。
解像度スケーリング。 VAE圧縮なしの条件では、64および128 pxにおいてTSDFは占有ベースと比べてHausdorff距離が大幅に小さく、256以上では両者が収束し、256×256が適切な動作解像度であることが検証されます。TSDFの優位性は平坦な平面形状のABO家具よりも密なしわや不規則な裾を持つGarmageSetで大きく、連続的な境界エンコーディングの効果が境界の複雑さに比例するという主張と整合しています。
初期化。 ランダム初期化VAEはCD 0.47\times10^{-3} を達成し、SD1.5初期化の 0.46\times10^{-3} と、GarmageSet上で同一のNC 0.96を示します。SD1.5の事前学習は収束を加速させますが、品質の源泉ではなく、TSDF表現そのものが寄与しています。
データ拡張。 UVチャートの配置を摂動させることで、3D意味論を変えることなくABOのデータを3.8Kから500Kの学習サンプルに拡張できます。拡張なしではDiT-BaseはABOで発散し、DiT-Tinyのみが安定して学習しますが、拡張ありではDiT-Baseが収束し定性的にDiT-Tinyを上回ります。ジオメトリイメージが3D信号の構造化された2Dエンコーディングであるからこそ、この拡張が正当なものとなります。

定性的には、GarmageSetの画像→3D生成において、TRELLISは閉じた形状の事前分布により衣服を肥厚させ、GarmageNetは二値占有に由来する階段状のエイリアシングを境界に示します。DiffGIはより少ない頂点数でカラー・袖・裾をクリーンに再現します。
限界と未解決の問題
- サドル曖昧性の解消は決定論的なハックです。1セル内に真に狭い橋状構造があれば分割されますが、256×256でのパッキングパディングによりチャートが離れているため安全です。
- TSDFは3D表面ではなく2D UVプレーン上で定義されているため、固有測地距離ではなくUVチャート形状をエンコードします。したがって境界の忠実度はUVパッキングの品質に依存します。
- チャートシーム間の非多様体ジャンクションは依然として位置マップの連続性と拡張処理に依存しており、明示的なシーム縫合lossは存在しません。
- 評価はOmages/GarmageNetおよびTRELLISとの比較に留まり、近年のGaussian-surfelやflow-baseのメッシュ生成器との比較は含まれていません。
- 15 pxでの切り捨てと256解像度は結合しており、512以上への拡張や高種数曲面への適用は検討されていません。
なぜ重要か
薄殻および開放表面の3D生成は、閉じたボリュームを仮定するか境界を粗く離散化する表現によってボトルネックとなってきました。DiffGIは、二値チャンネルを連続的な2D TSDFと微分可能マーチングスクエア層に置き換えるだけで、Chamfer誤差を半分以上削減し、2D VAEに対して直接3D空間の教師信号を与えられることを示しています。これは小さなアーキテクチャ変更でありながら、衣服やその他の非多様体アセットに対して不釣り合いなほど大きなインパクトをもたらします。
Source: https://arxiv.org/abs/2607.13365
LLM-as-a-Coach: 検証不可能なタスクのための経験的学習
問題
オープンエンドかつ検証不可能なタスク(創作文章、指示追従、会話支援など)に対するLLMのpost-trainingは、通常、LLM-as-a-Judgeがルーブリックに基づいてon-policyな応答をスコアリングするアプローチに依存しています。その後、RLがスカラー報酬を最適化します。この圧縮は二つの意味で情報が失われます:(i) judgeのテキスト分析——スコアの背後にある実際の診断内容——が破棄される点、および (ii) スコア分布の上位において最も細かい区別が重要であるにもかかわらず、たまたま同じ数値バケットに収まる異なる品質プロファイルの応答が混同される点です。著者らは、この帯域幅ボトルネックこそが、検証不可能なタスクにおける汎化性能の低下とreward hackingを引き起こすと主張しています。
手法
経験的学習(Experiential Learning; EL)は、同一のフィードバックモデル M をLLM-as-a-Coachとして再定式化します。ルーブリック集合 \mathcal{R}_x を持つプロンプト x とon-policyな応答 y \sim \pi_\theta(\cdot\mid x) に対して、coachは M(x, y, \mathcal{R}_x)——完全なテキスト評価——を生成します。スカラー値を抽出する代わりに、ELはcoachの評価を経験的知識 e に蒸留します:これは特定の (x,y) インスタンスを超えて適用可能な、転移可能な教訓(どのルーブリック基準に対して何がうまくいき、何が失敗したか)です。

その経験的知識はteacher \pi_{\text{teacher}}(y \mid x, e)——固定された初期ポリシー、またはコンテキストとして e を与えて再プロンプトされた現在のポリシーのいずれか——に条件付けられます。student ポリシー \pi_\theta は、on-policy context distillation(OPD)によって学習されます:e をin-contextに持たない状態で自身が動作しながら、teacherの条件付き分布に一致させます。具体的には、トークンレベルのKLを最小化します:
\mathcal{L}_{\text{EL}}(\theta) = \mathbb{E}_{(x,\mathcal{R}_x)\sim\mathcal{D},\, y\sim\pi_\theta} \big[ D_{\mathrm{KL}}\big(\pi_{\text{teacher}}(\cdot \mid x, e) \,\|\, \pi_\theta(\cdot \mid x)\big) \big],
ここで e = \text{Distill}(M(x, y, \mathcal{R}_x)) です。RLのベースライン(GRPO)と対比すると、GRPOは以下を最適化します:
\max_\theta \mathbb{E}_{(x,\mathcal{R}_x)\sim\mathcal{D},\, y\sim\pi_\theta}[r], \quad r = \text{Extract\_Reward}(M(x,y,\mathcal{R}_x)).

このパイプラインはルーブリックベースの評価プロトコル(同一の M、同一の \mathcal{R}_x)を保持しつつ、M の出力から何を保持するか、およびそれがどのようにgradientに反映されるかを変更します。主要な設計上の選択肢:
- 同一フィードバックモデル:RLとELの両方で使用し、フィードバックモデルの能力からシグナル帯域幅の効果を切り離します。
- teacherのバリアント:固定された初期ポリシーteacher(シンプルで安定)vs. iterativeなteacher(e に条件付けられた現在のポリシー)。iterativeなバリアントでは、能力のドリフトを防ぐために、Tulu3プロンプトを1:0.25の比率で混合し、固定ポリシーをOPD teacherとして使用します。
- 学習データ:7500件のWildChat-IFプロンプト;ルーブリックはGPT-4oによって事前生成され、RLとELで同等性のために再利用されます。
- ポリシー:Qwen3-8B(non-thinking)およびOLMo-3-7B-Instruct。CoachはいずれかのポリシーのinitialチェックポイントまたはGPT-4oです。
主張は、e がスカラー r が破棄する情報——具体的には、どのルーブリック軸が失敗したか、そしてどのように失敗したか——を保持しており、その軸を共有する未知のプロンプトへの転移を可能にするという点です。
結果
ELは、保留データおよび未知のオープンエンドbenchmarkにおいて、両ポリシーファミリーおよび両coachの選択肢(self-coach vs. GPT-4o)において一貫してルーブリックベースのRLを上回ります。

図3の汎化パターンは、本論文の主要な実証的知見です:RLはWildChat学習サブセットでより高いスコアを達成しますが、ELは保留データおよびOODスプリットで優位に立ちます。これはreward hackingと整合しています:RLは学習分布上のjudgeの固有の癖に適合する一方、ELはスコアの背後にある理由を教師信号として使用することで、転移可能な行動を生成します。著者らはまた、ELがreward hackingを直接軽減することも報告しています(例えば、RLが長さや書式の手がかりを利用して、内容を改善せずにルーブリックスコアを水増しする場合など)。
限界と未解決の問題
- 本論文のメカニズムは、coachが高品質かつ転移可能な e を生成することに依存します。coachが初期ポリシー自身である場合(self-coach)、e の品質の上限はそのポリシー自身のルーブリック推論能力に制約されます;論文ではこれでも機能することを示していますが、self-coachingとGPT-4o coachingの上限の差は十分にマッピングされていません。
- OPDは更新ごとにteacherとstudentの両方のforward passを必要とします;GRPOと比較した実時間コストは、提供されている資料では分析されていません。
- M の生の出力から e を抽出する作業自体が蒸留ステップであり、そのプロンプト設計は重要である可能性が高いですが、本論文ではアブレーションされていません。
- 結果は、GPT-4oに品質が依拠したルーブリックを持つ7B〜8Bのポリシーにおけるものです。スケーリング挙動——より大きなポリシーが自身の批判能力がcoachに追いつくにつれて、依然として恩恵を受けるか——は未解決のままです。
- ルーブリックの分解自体が設計軸であり:e がエンコードする構造が少なくなるほど粗いルーブリックの下では、ELの優位性が縮小する可能性があります。
なぜこれが重要か
検証不可能なタスクに対するルーブリックベースのRLは、judgeが実際に知っていることの大部分を捨て去っています。同一モデルをcoachとして扱い、on-policy context distillationを通じてそのテキスト診断を蒸留することで、その帯域幅を回復し、さらに重要なことに、OODの汎化性能を向上させながらreward hackingを抑制します——これはRLAIFスタイルのパイプラインにおける既存の失敗モードの一つに対する直接的な回答です。
Source: https://arxiv.org/abs/2607.18110
HarmoHOI: Harmonizing Appearance and 3D Motion for Multi-view Hand-Object Interaction Synthesis
問題設定
マルチビュー手・物体インタラクション(HOI)合成は、2つの困難な問題の交差点に位置します。すなわち、重い遮蔽下における細粒度の関節手動作のモデリングと、視点間の幾何学的一貫性の確保です。純粋な動画 foundation model は尤もらしい単一視点映像を生成できますが、明示的な3D表現を持たないために複数視点間でドリフトが生じます。一方、幾何学優先のパイプライン(MANOフィッティング、物理シミュレータ)は一貫した動作を生成できるものの、外観の品質と汎化性能に難があります。HarmoHOIの前提は、両者を共同生成しなければならないというものです。つまり、複数視点間の外観一貫性は共有されたメトリックスケールの3Dモーションフィールドに固定されている場合のみ実現でき、3Dモーションは強力な視覚的事前知識によって誘導される場合のみ復元可能です。
タスクの定義は次のとおりです。参照画像 I \in \mathbb{R}^{H\times W\times 3}、ターゲットカメラポーズ \Pi=\{\pi_v\}_{v=1}^{V}、およびプロンプト P が与えられたとき、マルチビュー動画 V \in \mathbb{R}^{V\times T\times H\times W\times 3} とメトリックスケールの3Dポイントトラック M \in \mathbb{R}^{V\times T\times K\times 3} を同時に生成します。

手法
HarmoHOI は、時空間 VAE を持つ Rectified-Flow text-to-video DiT 上に構築された2段階拡散システムです。ベースモデルは速度を予測します。
v_t = \mathrm{d} z_t/\mathrm{d} t = z_1 - z_0,\qquad z_t=(1-t)z_0 + t z_1,
\mathcal{L}=\mathbb{E}\|v_t-\hat v_\Theta(z_t,c,t)\|_2^2 で学習し、z_{t-1}=z_t+\Delta t\,\hat v_\Theta(z_t,c,t) でデノイズします。
Mixture of Multi-view Diffusion Transformer(M^2DiT)。 第1モジュールは、(i) 同期されたマルチビューRGB latent、(ii) 3Dポイントトラックを RGB 様テンソルとして符号化する中間的な「モーション擬似動画」、および (iii) シーケンスごとのグローバルメトリックスケールスカラーを同時生成します。3Dトラックを擬似動画として表現することが重要な適応トリックです。これにより幾何学的シグナルが事前学習済み VAE と DiT が動作するのと同じ2D latent 空間に置かれるため、モデルは未知のモダリティを一から学習するかわりに空間・時間的事前知識を再利用できます。DiT ブロック構造(時間変調、visual self-attention、テキスト cross-attention、MLP)は保持されており、マルチビュートークンが共同でアテンションされることでエピポーラ構造が暗黙的に出現します。
Global Motion Aligning Diffusion(GloMAD)。 擬似動画のデコードによって粗いビューごとのポイントトラックが得られますが、これらはメトリックスケールやグローバルアライメントが保証されていません。GloMADは、これらの粗いトラックを条件として受け取る第2の拡散プロセスであり、精緻化されたメトリックスケールかつグローバルに整合した3D軌跡を出力します。推論時には、M^2DiT と GloMAD がクローズドループを形成します。すなわち、各デノイジングステップにおいて精緻化された3Dモーションが次のRGB・擬似動画速度予測を誘導するためにフィードバックされ、外観と幾何学が逐次的に切り離されるのではなく共進化します。

ハイブリッドデータカリキュラム。 マルチビューHOIデータは希少であるため、学習は3段階で進行します。(1) HOIGen1M(Depth Anything 3 によって深度・ポーズが推定された100万件以上の単一視点HOIクリップ)を用いた単一視点幾何学認識学習、(2) SynCamVideo(UE5アセットによる3,400シーン × 10カメラ = 34,000クリップ)を用いたマルチビュー外観同期、(3) TACO(25,000クリップ、12視点、グラウンドトゥルース3D)を用いたマルチビュー外観・幾何学の統合学習です。段階1および2は事前学習済みの視覚的多様体を保持しつつ幾何学とクロスビュー一貫性を段階的に注入し、段階3では実際のマルチビューHOIからの教師信号のもとで両者を統合します。

評価設定と期待される結果
動画品質の評価には、単一視点の忠実度について VBench Subject Consistency および Dynamic Degree を使用し、クロスビュー一貫性については Matching Pixels(GIM 経由)と CLIP-Views を使用します(SynCamMaster に倣う)。モーション品質は、精度(GeometryCrafter に倣った Chamfer Distance、Motion Smoothness、Relative Point Error(RPE)、Percentage of Inliers(PI))と妥当性(貫通率、非接触率)に分解されます。マルチビューモーション一貫性については、クロスビュー再投影後の同一精度指標を使用します。これはグローバルに整合していないトラックが任意の再投影において大きな Chamfer 誤差を引き起こすため、厳格なテストとなります。
TACOは、ツール・アクション・ターゲットの三つ組構造(20の物理カテゴリ、196インスタンス、15アクション、14名の参加者)にわたる汎化性能をテストするため、保留済みの物体・アクションペア(例:「ハンマー」、「測定」)で分割されており、残りを9:1のトレイン・バリデーション分割としています。
制限事項と未解決の問題
- ポイントトラックの擬似動画符号化は、VAEの帰納バイアス(局所的滑らかさ、パッチ構造)が3D座標フィールドに適切であることを前提としており、トラック内の突然の遮蔽境界は適切に再構成できない可能性があります。
- グローバルスケールはシーケンスごとのスカラーとして出力されるため、関節的なスケール曖昧性を持つシーン(例:ズームとドリーの区別)や、疎に結合した複数物体を含むシーンには単一スケールでは対応が難しい場合があります。
- HOIGen1M の深度・ポーズ擬似ラベルは Depth Anything 3 から得られるため、段階1の教師信号は単眼深度のバイアス、特に細い指や把持ツール周辺のバイアスを継承します。
- クローズドループの M^2DiT ↔︎ GloMAD デノイジングは単一パス DiT と比較して推論コストをほぼ2倍にし、Rectified Flow 下での収束特性は形式的に特徴付けられていません。
- 接触・貫通は評価されていますが、損失として明示的に強制されていないため、物理的に実行不可能なグラスプが VBench スタイルの指標で依然として高く評価される可能性があります。
意義
HarmoHOI は、事前学習済み動画 DiT に3D幾何学を注入するための具体的なレシピを実用化しています。その方法は、幾何学をモデルの latent 空間を共有する擬似動画として符号化し、外観デノイジングとメトリックスケールモーション精緻化の間のループを閉じるというものです。クローズドループの共進化が HOI を超えて汎化するならば、既存の text-to-video 基盤の上にスクラッチから学習するのではなく、マルチビュー一貫性を持つワールドモデルを構築するためのテンプレートを提供します。
Source: https://arxiv.org/abs/2607.17097
Hacker News Signals
arXiv上のAI執筆をどのように測定し、どこで測定が破綻するか
Unslopチームは、arXivのアブストラクトおよび全文の大規模サンプルにAI執筆検出器のスイートを適用し、シグナルが劣化する箇所を記録しました。核心的な技術的知見は、現在の分類器——そのほとんどがGPTスタイルの出力でfine-tuningされ、2023年以前のデータで学習されている——が、密度の高い技術的文章に対して系統的な偽陽性率を示すというものです。ドメイン固有の語彙(LaTeXを多用した記法、分野の専門用語、引用が密な文章)は、パープレキシティおよびバースティネスの特徴量を、テキストが人間による執筆であっても分類器がLLMの出力と関連付ける分布へと押し込みます。
方法論のセクションが最も有益な部分です。参照LMを用いてトークンレベルのパープレキシティを計算し、次に「binoculars」比(2つの関連モデル間におけるパープレキシティの比)を適用し、分類器のアンサンブルと比較しています。分析の崩壊点として、英語を母語としない研究者が執筆したアブストラクトがAI可能性指標において系統的に高いスコアを示すことが示されています——これはよく知られた交絡因子であり、ほとんどのデプロイ済みツールはこれを補正していません。また、おそらく現実世界で最も多いケースである、fine-tunedまたは軽微に編集されたLLMの出力は、現在の分類器の閾値では純粋な人間のテキストとほぼ区別がつかないとも指摘しています。
この投稿の最も誠実な部分は「測定が破綻する箇所」のセクションです。透かし(watermarking)は大規模にはデプロイされておらず、グラウンドトゥルースのラベリング問題は遡及的分析においては手に負えず、既知のLLMデータで学習された分類器はモデルが改善されるにつれて共変量シフトの問題を抱えます。結論として実質的に述べられているのは、集計的なトレンド検出(閾値を超える論文の割合)にはある程度の妥当性があるが、個別論文の分類には妥当性がないということです。
これは、同様の方法論を用いて同様のキャリブレーション上の注意点に達した、学術アブストラクトにおけるChatGPT利用に関するLiang et al. EMNLP 2024の論文と並べて読む価値があります。
Source: https://unslop.run/blog/measuring-ai-writing-on-arxiv
LoRA Speedrun – fine-tuning技術のための公開wall-clockリーダーボード
このリポジトリはLoRA fine-tuningを競争的なベンチマークとして位置づけています。固定タスク(現在は7Bクラスのモデルのシングルタスク instruction tuningとしています)が与えられた上で、検証lossまたは精度の目標閾値に到達するまでのwall-clock時間によって提出物がランク付けされます。リーダーボードは時間だけでなく、ハードウェアスペック、ピークVRAM、そしてrank r、alpha、対象モジュール、optimizer、batch size、precisionといった正確な設定も追跡します。
技術的な観点で興味深いのは、実際に効果を発揮する変種が何かという点です。現在の上位エントリは複数の直交するトリックを活用しています。(1) reduce-overheadモードを用いたtorch.compileで、LoRAのforward passを融合しPythonのオーバーヘッドを排除する。(2) VRAMが許す場合、gradient checkpointingを無効化して大きなマイクロバッチを優先する。これは小さいrankでは再計算コストがメリットを上回るためです。(3) optimizer statesも含め全体を通じてbfloat16を使用し、mixed-precisionキャストのオーバーヘッドを回避する。(4) 短いシーケンスをパッキングしてcontext windowを埋め、パディングの無駄を排除する。
このリポジトリはLoRA rankスケジューリングに関する微妙な点も浮き彫りにしています。高いrankから始めて減衰させる(learning rateのウォームアップに類似した)手法が一部の提出者において高速化を示しましたが、そのメカニズムは明らかではありません。初期の高rank更新が後期のものよりも収束において重要である可能性が考えられます。
このベンチマークの設計にはいくつかの問題点があります。wall-clock timeはハードウェア依存であり、H100クラスタからの提出はコンシューマGPUのエントリと直接比較できません。リポジトリはFLOP推定値への正規化でこの問題に対処していますが、FLOP正規化は小さいbatch sizeで支配的なメモリ帯域幅のボトルネックを見逃します。それでも、リーダーボード形式は静的なベンチマークでは生まれないような有用なアブレーションの圧力を生み出しています。
Source: https://github.com/Saivineeth147/lora-speedrun
LLMにおける推論努力量の制御
RaschkaのポストはLLMの「思考」またはchain-of-thoughtの計算量をinference時に抑制・拡張するためのメカニズムを概観しており、APIレベルの制御とアーキテクチャ的アプローチの両方を取り上げています。実用的な問題として、o3やQwQのような推論モデルは中間ステップに可変のトークンバジェットを費やしており、多くのクエリに対してそのバジェットは無駄が多いという点があります。
APIレベルでは、プロバイダーが reasoning_effort パラメータ(OpenAI)や thinking トークンバジェット(Anthropic)を公開しており、最終回答が生成される前のスクラッチパッド推論に割り当てられるトークン数を直接制限します。このポストでは、これが単なる打ち切りではないことを説明しています——モデルはRLVR(reinforcement learning with verifiable rewards)によって様々な長さの推論トレースで学習されており、バジェットシグナルがpromptまたはシステムコンテキストに存在する場合に推論ステップを圧縮またはスキップすることを学習します。
より興味深いアーキテクチャ的な観点として、budget-forcingが取り上げられています。これはトレーニング中に <budget>N</budget> トークンを先頭に付加し、Nトークン以内の推論で正解を生成することに対してモデルを報酬付けるテクニックです。これにより、inference時に未見のバジェット値に対して汎化できるモデルが得られます。また、Qwen3などのモデルで特殊トークンを用いて実装された「thinking on/off」トグルも紹介されており、/no_think システムプロンプトにより <think> ブロックを完全に抑制し、モデルを標準的な指示追従モードに切り替えます。
キャリブレーションの問題は未解決のままです:ユーザーやシステムは特定のクエリに対してどの程度の努力量が適切かをどのように判断すべきでしょうか?ポストでは、クエリの複雑さ分類に基づくルーティングが活発な研究領域であることを指摘していますが、現在のヒューリスティクス(質問の長さ、数学記号の有無)は粗雑なものです。生成前に必要な推論深度を予測する学習済みルーターはこのギャップを埋めることができますが、努力量対精度のラベル付きデータが必要です。
Source: https://magazine.sebastianraschka.com/p/controlling-reasoning-effort-in-llms
Qwen-Image-3.0: リッチなコンテンツ、本物らしい詳細、深い知識
Alibabaの画像生成モデルQwenは、3つの改善点を主張しています:タイポグラフィ的に正確なテキストレンダリング、密なシーンにおける写実的な詳細表現、そして知識に基づく生成(名前付きエンティティ、図表、技術的なコンテンツの事実整合的な描写の生成)です。ブログ記事にはアーキテクチャに関する詳細な記述は少ないものの、テキスト理解ブランチと画像合成ブランチをテキスト・画像の一貫性を重視したキュレーションデータセット上で共同学習するデュアルストリームの学習アプローチが説明されています。
テキストレンダリングの改善は、技術的に最も具体的な主張です。従来のdiffusionモデルが画像中のテキスト表現に苦労するのは、文字レベルの空間的一貫性を実現するためにトークン順序への注意が必要であり、CLIP embeddingに対する標準的なcross-attentionではそれが自然に強制されないためです。Qwen-Image-3.0は、CLIPのボトルネックを回避し、空間的なグリフ情報をdenoisingネットワークに直接入力する文字レベルのエンコードパスを使用しているようです。その結果、非ラテン文字スクリプトを含む複数単語のテキストが生成画像中で判読可能となっており、これは真の差別化要因といえます。
「深い知識」という枠組みは、名前や説明文でプロンプトを与えた際に、正確な分子図、回路図、建築平面図を生成するといったケースをカバーしています。これはおそらく学習データのキュレーションに大きく依存しており、モデルが十分な(説明文、図)のペアを学習していれば、真に「理解」していなくても構造的なパターンを再現できます。
制限事項:このブログはリリース時点でモデルの重みや技術レポートを公開していません。引用されているベンチマーク数値は内部評価によるものです。DALL-E 3、Imagen、Midjourneyとの比較は、標準化された人間による評価ではなく、都合のよい例の選択に基づいています。再現可能な評価が利用可能になるまで、知識に基づく生成の主張を独立して検証することは困難です。
Source: https://qwen.ai/blog?id=qwen-image-3.0
エージェントスワームと新たなモデル経済学
CursorのエンジニアリングブログPost は、単一タスクに対して多数の並列LLMエージェントを実行する場合(彼らが「スワーム」と呼ぶ構成)と、逐次的な単一エージェント動作との間に生じるコストとレイテンシの構造を分析しています。核心的な主張は、エージェントの並列化に関する経済学は単一呼び出しをスケールさせる場合の経済学とは異なるものであり、それによってどのモデルを使用する価値があるかが変わってくる、というものです。
重要な会計的考察として、あるタスクが強力なモデルを用いてステップあたり$Xのコストで10の逐次ステップを要する場合、10の並列サブエージェントにファンアウトするスワームは各エージェントが1ステップを担当することで高速に完了できますが、同じモデルを使用すると$10Xのコストがかかります。したがって、サブタスクにはより安価で弱いモデルを使用し、強力なモデルはオーケストレーションと統合のために温存するという動機が生じます。これは単一のエージェントパイプライン内での異種モデルルーティングに関する実践的な議論です。
この記事では、レイテンシとコストのPareto frontier フレームワークを導入しています。あるタスクに対して、スワームの幅と各レベルでのモデル階層を変えることで、達成可能な(レイテンシ、コスト)のペアを描き出すことができます。彼らの実験データが示すところでは、このフロンティアは非凸であり、中間tier のモデルを用いた適度な並列化が、単一の強力モデルと大規模並列の弱いモデルの両方のアプローチを支配する「スイートスポット」が存在します。
技術的な観点から、この記事は困難な部分についても正直に述べています。すなわち、タスクを並列化可能なサブタスクへと分解することは自動的ではなく、調整のオーバーヘッド(コンテキストの受け渡し、結果のマージ)はスワームの幅が広がるにつれて増大し、障害モード(不良なサブエージェント1つが最終的な統合結果を破損させる)の上界を求めることは困難です。彼らの言及によると、ほとんどの性能向上は最初の4〜8並列エージェントから得られており、それ以降は収穫逓減と調整コストが支配的になるとのことです。
Source: https://cursor.com/blog/agent-swarm-model-economics
Qwen 3.8
Alibabaは、Qwen3ファミリーの密な8BパラメータモデルであるQwen3-8Bをリリースしました。最も議論されている技術的特性は、ハイブリッドなthinking/non-thinkingモードです。このモデルは、明示的なchain-of-thoughtスクラッチパッドを有効化または抑制する/thinkおよび/no_thinkシステムプロンプトトグルをサポートしており、語彙内の特殊トークンを介して実装され、可変長の推論トレースに対してRLVRで訓練されています。
HNでの議論を牽引しているbenchmark数値として、Qwen3-8Bはthinkingモードでのmath-500およびLiveCodeBenchにおいてGPT-4o-miniと同等かそれ以上の性能を示すとされており、MMLUでははるかに大規模なモデルと競争力のある性能を発揮します。HNのコメントはオープンウェイトでのリリースに強く注目しており、このモデルはApache 2.0のもとで利用可能であり、制限なく商用のfine-tuningおよびデプロイが許可されています。
アーキテクチャはQwen2.5の基盤に従っています。8つのKVヘッドを持つgrouped-query attention(GQA)、RoPE positional embeddings、SwiGLU activations、そして32Kの学習コンテキストからYaRN外挿による128Kのコンテキストウィンドウを採用しています。tokeniserはQwen3ファミリー全体で共有されており、語彙サイズは152Kです。これにより、以前のバージョンの32K語彙と比較して、非英語言語のtokenization効率が向上しています。
コメントでのコミュニティの懸念は、推論訓練データの出所に集中しています。具体的には、RLVRの訓練が大規模なクローズドモデルからのdistillationを使用していたかどうかという点であり、もしそうであれば、一部のプロバイダーの利用規約のもとでApache 2.0ライセンスが法的に問題となる可能性があります。Alibabaは完全な訓練データカードを公開していません。MoEの別バリアント(Qwen3-235B-A22B)も報告された性能で注目を集めましたが、8Bの密なモデルがほとんどのHN読者にとって実際にデプロイ可能なモデルです。
Source: https://twitter.com/Alibaba_Qwen/status/2078759124914098291
GPT5.6と$25でWordPress RCEを発見した話
この投稿は、著者がLLM(「GPT5.6」と表記されており、APIを通じてアクセスしたGPT-4.5またはoシリーズモデルを指すと思われます)を活用して、WordPressプラグインのコードをリモートコード実行(RCE)脆弱性についてauditing するワークフローを記録したものです。APIの総費用は約$25でした。
技術的な内容としては、著者はプラグインのPHPソースコードをチャンク単位でモデルに入力し、危険な関数呼び出し(eval、unserialize、system、passthru、ファイル書き込みのsink)を特定させ、HTTPの入力からそれらのsinkへのデータフローをトレースさせました。モデルの出力はそのまま悪用可能なものではなく、脆弱性の候補パターンを生成したに過ぎず、著者はそれを手動で検証した上でPoCエクスプロイトを構築しました。LLMは自律的なエクスプロイト生成器としてではなく、トリアージおよびパターンマッチングの層として機能しました。
発見されたRCEのクラスは、任意ファイル書き込み(サーバーサイドでファイル拡張子を検証しないプラグインのメディア処理機能を悪用)と、Webアクセス可能なディレクトリにPHPファイルを設置するpath traversalの組み合わせでした。これはWordPressプラグインにおける典型的な脆弱性クラスであり、新規性は発見手法のコスト効率にあります。$25のAPI費用で、複数のプラグインにわたる約15,000行のPHPのauditing をカバーしました。
この投稿が示すより広い示唆——エクスプロイトブローカーの報酬(WordPress RCEに対して$500Kが引用されています)が、費用のかかるAI支援auditing に対しても正のROIをもたらすという点——は単純な計算です。この投稿が十分に答えていない、より興味深い技術的な問いは偽陽性率です。真陽性を発見するまでに、LLMがフラグを立てたパターンのうち何件を調査する必要があったのでしょうか?投稿では少ない数であることをほのめかしていますが、正確な数字を示していないため、このコスト効率を再現することは困難です。
AIエージェントにおけるランダムな週次クォータリセットの仕組みとは?
Max Woolfの投稿は、観察されたパターンに関する運用分析です。AIコーディングエージェントやAPIベースのツールが、月次やリクエスト単位ではなく週次のサイクルで使用クォータをリセットしており、そのリセット時刻が実質的に予測不可能なほど不規則であるというパターンを取り上げています。この投稿では、なぜこのようなパターンが生まれたのか、またワークフローをこれらのツールに合わせて計画しているユーザーにとってどのような意味を持つのかを検討しています。
Woolfが導き出した技術的な説明は、予測困難な需要に対するリソース管理です。ソフトなリセットウィンドウを持つ週次クォータにより、プロバイダーはローリング7日間ウィンドウにわたってGPUアロケーションを平滑化し、より洗練されたアドミッションコントロールインフラを必要とするハードなper-secondレート制限にコミットすることなく、バースト使用を吸収できます。リセット時刻が不規則(UTC深夜でも固定曜日でもない)なのは、意図的なアンチゲーミング対策です。リセットが予測可能であれば、ユーザーはリセット直後にコストの高いエージェント実行をバッチ処理し、スパイク問題を再発させてしまうからです。
この投稿では、クォータ設計とエージェントタスク構造の相互作用についても取り上げています。長い多段階タスクを実行するエージェントは、タスク途中でのクォータ枯渇に対して不釣り合いなほど敏感です。これにより、リカバリーコストが高い部分的な作業状態が生じます。成功か失敗かをアトミックに完了する単一の completion 呼び出しとは異なり、ステップ35でクォータに達した50ステップのエージェント実行では、部分的に適用されたdiffや半分だけ実行されたプランがユーザーに残されます。
実践的な推奨事項は、エージェントオーケストレーション層に明示的なチェックポイントとレジューム処理を組み込むことです。これはどのプロバイダーのクォータモデルを使用している場合にも適用されるシステムエンジニアリング上の指摘です。主要なプロバイダーのいずれもクォータリセットのセマンティクスを正確にドキュメント化していないため、その上に堅牢なツールを構築することは本質的に困難であると、この投稿は指摘しています。
注目の新しいリポジトリ
arcships/light-ocr
Node.jsおよびC++ランタイムをターゲットとした、PaddleOCRのPP-OCRv6モデルパイプラインをベースに構築された、高速なオフラインOCRライブラリです。このスタックはApple SiliconeではCore ML、対応GPUではWebGPUによるハードウェアアクセラレーションを活用し、完全なオンデバイス動作を実現しており、ネットワークの往復通信やクラウドAPIへの依存を一切排除しています。認識パイプラインはバウンディングボックス座標と検出ごとの confidence score を返すため、単純な生テキスト抽出にとどまらず、文書レイアウト解析にも適しています。npmパッケージ @arcships/light-ocr はNode.jsプロジェクトに直接統合できるほか、C++インターフェースによってネイティブアプリケーションやWASMビルドへの組み込みも可能です。PP-OCRv6は、蒸留による軽量な検出ヘッドと、ラテン文字およびCJK文字全体にわたって速度と精度のバランスを取った洗練された認識バックボーンにより、以前のPaddleOCRバージョンからの改善が図られています。Core MLおよびWebGPUバックエンドにより、演算の大部分においてCPUを使わずに推論が実行されるため、バッチ文書処理のようなスループット重視のワークロードにおいて重要な意味を持ちます。Tesseract(CPU専用・レガシーアーキテクチャ)やクラウドOCR API(レイテンシ・コスト・プライバシーの問題)と比較すると、このライブラリは有用な中間的位置付けにあります。すなわち、現代的なモデル品質とオフライン保証を両立しています。主な未解決事項は、多言語モデルのカバレッジと、バンドルされているモデルの重みがサイズ削減のために量子化されているかどうかという点です。
Source: https://github.com/arcships/light-ocr
elder-plinius/T3MP3ST
複数の攻撃的セキュリティエージェントをターゲットシステムに対して協調動作させる、自律型レッドチーミングメタハーネスです。アーキテクチャはマルチエージェントループ構造をとっており、専門化されたサブエージェントがそれぞれ異なる攻撃フェーズ(偵察、脆弱性列挙、エクスプロイト選択、ペイロード配送)を担当し、状態を追跡してフィードバックに基づいて戦略を適応させるメタコントローラによって調整されます。「メタハーネス」という位置付けが示すように、T3MP3ST自体はエクスプロイトを直接実装するのではなく、既存のツールとLLMベースの推論エージェントをラップし、構造化されたタスク割り当てを発行して結果を集約します。これはオーケストレーション層としてLangGraphやAutoGenといったフレームワークと自然に対応しており、標準的なセキュリティユーティリティ(nmap、Metasploit、カスタムスクリプト)へのtool-callインターフェースを備えています。手動ペネトレーションテストや単一エージェントアプローチに対する優位点は持続性にあります。メタコントローラは失敗した攻撃経路を再試行し、発見した足がかりを起点に横断移動し、長時間のセッションを通じて一貫した攻撃グラフを維持することができます。スター数の急速な増加(5,000以上)は、LLM強化型攻撃的セキュリティ研究への広範な関心を反映しています。主要な技術的懸念事項としては、フィードバックループにおけるprompt injection、エクスプロイトの実行可能性に関するハルシネーション、そして明らかなデュアルユースリスクが挙げられ、責任ある利用には制御されたラボ環境が必須です。コードベースは初期段階にあり、自律的な意思決定の品質は実行時に選択される基盤LLMに大きく依存します。
Source: https://github.com/elder-plinius/T3MP3ST
mereyabdenbekuly-ctrl/clodex-ide
検証可能な自律的ソフトウェア開発を目的として設計された、ローカルファースト・ゼロトラストの agentic IDE です。ここでいう「ゼロトラスト」はエージェント自体に適用されます。すなわち、エージェントのいかなるアクションも暗号学的に検証可能な監査証跡なしには実行されないようにシステムが設計されており、ファイルシステムおよびネットワーク操作はすべて明示的なケイパビリティ付与によってサンドボックス化されています。「ローカルファースト」という制約は、コード・エージェント履歴・タスクグラフといった主要な状態がクラウドではなく開発者のマシン上に存在し、同期はオプションであることを意味します。agentic レイヤーは高レベルの開発タスクを受け取り、それをサブタスク(テスト記述、実装、リファクタリング、CI 実行)に分解し、各チェックポイントでロールバック機能を備えながら実行します。これが Cursor や GitHub Copilot Workspace と差別化される点は、監査可能性への重点にあります。すべてのエージェントの意思決定とツール呼び出しは、変更が行われた理由を再構成できるだけの十分なコンテキストとともにログに記録されます。IDE 表面自体は標準的な拡張可能なエディタコア上に構築されているように見えます。実用的な訴求力が最も高いのは、自動か手動かを問わず全コード変更の監査ログが必要とされる、規制の厳しいまたはセキュリティ上重要な開発環境です。849 スターを獲得しており注目を集めていますが、サンドボックス分離の成熟度と検証スキームの忠実度が重要な未解決課題です。
Source: https://github.com/mereyabdenbekuly-ctrl/clodex-ide
badchars/darknet-mcp-server
ダークウェブおよび脅威インテリジェンス操作向けに66個のツールを公開するMCP(Model Context Protocol)サーバーです。MCPはAnthropicが策定した標準インターフェースであり、LLMに外部ツールへの構造化されたアクセスを提供するものです。このパッケージはLLMクライアントを脅威インテリジェンスワークステーションへと変換します。ツールのカテゴリは、侵害データの検索、ランサムウェアグループの追跡、Torの.onionサイトへのアクセス、マルウェアサンプルの解析、ブロックチェーントランザクションのインテリジェンス、エクスプロイトデータベースの検索、スティーラーログの解析にわたっています。実用的な観点では、アナリストが「ドメインXに関する最近のリークを表示して」や「このウォレットアドレスを追跡して」といった自然言語クエリを実行し、LLMが関連するツール呼び出しをオーケストレーションし、結果をパースしてレポートを合成できます。このサーバーは、既存のAPI(Have I Been Pwned系の侵害データベース、ransomware.live、各種脅威インテリジェンスフィード)およびTorプロキシ接続を統一されたMCPインターフェースにラップしていると考えられます。技術的価値は集約にあります。すなわち、異質なダークウェブデータソースを単一のツール名前空間に標準化することで、LLMベースのSOC自動化における統合コストを低減します。セキュリティおよび法的な考慮事項は重大です。.onionサービスや侵害データへのアクセスは、運用上のリスクと法的管轄の複雑さを伴います。本ツールは、認可された脅威インテリジェンスおよびセキュリティリサーチの文脈においてのみ適切に使用できます。
Source: https://github.com/badchars/darknet-mcp-server
TencentCloud/Octop
TencentCloudが提供するセルフホスト型のマルチユーザー・マルチエージェントAIアシスタントプラットフォームです。マルチエージェントアーキテクチャにより、それぞれのエージェントをロールやデータドメインに応じて専門化することが可能で、コードを担当するエージェント、ドキュメントQAを担当するエージェント、APIインテグレーションを担当するエージェントといった形で役割分担ができます。ルーティング層がユーザーのクエリを適切なエージェントにディスパッチするか、複雑なリクエストに対しては複数のエージェントをまたいで処理を合成します。マルチユーザーサポートには、ユーザーごとのセッション分離、パーミッションスコーピング、そしておそらく使用量追跡も含まれており、シングルユーザーのチャットボットではなく共有の社内ツールとしてデプロイできます。セルフホスト型であるため、すべてのデータがオペレーターのインフラ内に留まる点が、エンタープライズ向けSaaS AIアシスタントとの主要な差別化要因となっています。スタックは標準的なLLMバックエンド抽象化レイヤー(複数のモデルプロバイダーまたはローカルモデルをサポート)上に構築されており、Webフロントエンドとセッション管理・エージェントオーケストレーションを担うバックエンドサービスで構成されていると考えられます。Open WebUIやDifyといったオープンソースの代替製品と比較すると、TencentCloud傘下というOctopの立ち位置はTencentのクラウドサービスやモデル提供との緊密な統合を示唆していますが、セルフホスト型という設計はポータビリティも意識していることを示しています。現時点で236 starsと初期段階にあり、ドキュメントの品質と独自のモデルエンドポイントを持ち込む際の容易さが、今後の採用を左右する要因となるでしょう。
Source: https://github.com/TencentCloud/Octop
inbjo/MirrorProxy
アダプターベースのアーキテクチャを採用した、統合ミラー加速プロキシです。コアは汎用リバースプロキシであり、リクエストのルーティングとキャッシュを担当し、各アップストリームのプロトコルおよび認証の詳細をレジストリごとのアダプターが処理する形で拡張されています。同梱されているアダプターは、GitHubリリースのダウンロード、Docker/OCIレジストリのプル、npm、PyPI、Cargo、Goモジュールプロキシ、Composer(PHP)、およびOSパッケージミラーをカバーしています。アダプターパターンはここでは適切な設計です。各レジストリには固有のURL構造、認証フロー(DockerトークンAuth、Goモジュールプロキシプロトコルなど)、そしてキャッシュ無効化のセマンティクスがあるため、単一のモノリシックなプロキシでは保守が悪夢のようになるでしょう。ネットワーク制限のある環境(企業ネットワーク、npmjs.comやpkg.go.devへの接続性が悪い地域)のオペレーターは、これをローカルまたはエッジサービスとしてデプロイし、開発者は標準の環境変数オーバーライド(GOPROXY、PIP_INDEX_URL、NPM_CONFIG_REGISTRYなど)を介してツールチェーンをそこに向けます。このクラスのプロキシでは、接続の並行性要件からGoや類似のシステム言語による実装が一般的です。主要な技術的考慮事項としては、キャッシュの一貫性(古いパッケージは再現可能なビルドを破壊する可能性があります)、TLS終端と証明書の取り扱い、そしてアップストリームレジストリがAPIを更新するたびにアダプターロジックを最新に保つ運用上の負担が挙げられます。
Source: https://github.com/inbjo/MirrorProxy
MIgHTy-alIeN/Trading-Bot
オンチェーンアービトラージシステムを2つのコンポーネントに分割した構成です。一方はトークンスワップをアトミックに実行するSolidityスマートコントラクト、もう一方は価格をモニタリングしてコントラクトをトリガーするオフチェーンの自動化スクリプトです。コントラクトはアービトラージロジックをエンコードしています。具体的には、flash loanによる借り入れ、2つ以上のDEXをまたいだマルチホップスワップ、返済、利益抽出を単一のアトミックトランザクションとして実行し、純利益がマイナスになった場合はrevertすることで実行リスクを排除します。外部スクリプトはレイテンシに敏感な処理を担当します。具体的には、mempoolイベントやブロック更新のサブスクライブ、view callによるオンチェーンリザーブのクエリ、ガスおよびフィーを差し引いた期待利益の計算、スプレッドが閾値を超えた際のトランザクション送信などです。主なターゲットはUniswap v2/v3およびSushiswapのプール間の価格乖離であり、利益獲得の時間窓は一般的にミリ秒単位です。技術的な課題としては、コントラクトにおけるガス最適化(opcodeを1つ節約するごとに利益につながります)、MEV競争(他のbotやブロックビルダーが同じ機会を検知します)、スリッページモデリングの精度が挙げられます。flash loan連携(AaveまたはAave類似のプロトコル)により、コントラクトに資本をロックする必要はなく、借り入れた元本は同一トランザクション内で返済されます。スター数546のこのリポジトリは数多く公開されているアービトラージbotリポジトリの一つですが、差別化要因はオフチェーンスクリプトにおける機会検出ヒューリスティクスの洗練度にあります。
Source: https://github.com/MIgHTy-alIeN/Trading-Bot
penecho/penecho
チャットパラダイムの外側に明示的に位置付けられた、AIによる推論支援のための空間的・マルチモーダルなキャンバスです。ターン制のテキストインターフェースの代わりに、このキャンバスは手書き入力、組版または手書きの数式、フリーハンドの図形、そしてタイプされたテキストを、2D空間上に配置されるファーストクラスのオブジェクトとして受け付けます。AIレイヤーは空間的なコンテキスト全体に対して動作します。ユーザーが自分の思考をプロンプトとして線形化することを強いられることなく、手描きの回路図とLaTeX数式、そして書き込まれたアノテーションをまとめて解釈することができます。これが技術的に興味深い理由は、空間的な関係を尊重したマルチモーダルな理解が必要とされるからです。図の中で矢印の隣に配置されたラベルは、同じラベルが単独で存在する場合とは異なる意味を持ちます。共有キャンバスの側面は、複数のユーザーとAIエージェントが同一のワークスペースを共有する協調セッションをサポートしており、リアルタイムの協調問題解決やチュータリングといったユースケースを可能にします。実装においては、ベクターキャンバスレイヤー(SVGまたはCanvas API)、インク認識と手書きテキスト変換パイプライン、そしてキャンバスのスナップショットや構造化表現をコンテキストとして受け取るマルチモーダルモデルバックエンド(GPT-4oまたは同等のvision-language model)が関与していると考えられます。研究上の困難な問題は、AIの応答を空間的にグラウンディングすること、すなわちフラットなスレッドに追記するのではなく、生成されたコンテンツをキャンバスの関連領域に紐付けることです。