研究
60 件
HarnessRisk、エージェント・ハーネスの安全性障害をベンチマーク
このベンチマークは、エージェント・ハーネスの各フェーズにおける攻撃を検証する。一方、関連研究ではタスクごとのプロビジョニングが検討されている。
Agent Lightning v1.0、ハーネス型エージェントRLを照準に
このフレームワークは、任意のエージェント・ハーネスを強化学習によるポストトレーニングに接続する。
論文、LLMのクロスモデル記憶転移を検証
研究者らは、学習済みの固定メモリをターゲット側リーダーを使って異なるモデル基盤間で移せるかを調べた。
DiSCO、ブラックボックス型text-to-imageの安全性に照準
arXiv論文は、モデルへのアクセスなしにNSFW出力を減らすプロンプトレベルの最適化を提案している。
PTXBench、LLMのGPUカーネル最適化能力を検証
このベンチマークは、H100およびB200 GPU上のGEMMとattentionワークロードで、アーキテクチャ固有のPTX活用を評価する。
研究者ら、エージェント・ハーネス向けRLフレームワークを提案
LEGO-RLとClawGym IIは、長期タスクに取り組むAIエージェントの強化学習を安定させることを狙う。
FACET、ターミナルタスク合成の一貫性向上を狙う
このフレームワークは、ターミナルエージェントの訓練に使う実行可能環境を構築・修復する。
SkillForge、リポジトリ固有のスキルでエージェントを訓練
このフレームワークは、プロジェクトの課題を合成し、将来のソフトウェア修正に再利用できる知識を抽出する。
IBM、AIエージェントに必要なメモリ量を検証
ALTK-Evolveの研究で、エージェントのメモリ効果はモデルの性能と提供方法に左右されることが示された。
研究者ら、トラックとドローンの配送経路問題「TTP-D」を提案
新たなベンチマークは、品目選択、積載量に応じた経路設計、ドローンとの同期を組み合わせたものだ。
監査・修復の文脈でLLMチェッカーがより寛容になるとの研究結果
arXiv論文は、モデルの文脈内に過去の監査・修復エピソードがあると誤警報が減ると報告している。
AlphaEvolve、行列乗算の上界を引き下げ
新たなarXivノートが、行列乗算指数の上界を改善したと報告した。
習得済みではなく、まだ残された部分を学ぶ:複数報酬の方策最適化に向けた飽和度を考慮した優位性の再重み付け
arXiv:2608.
TRACE-Bench、複数参照画像生成を対象に
このベンチマークは、プロンプトを4つの演算子に分解し、モデルの失敗要因を診断する。
Flow Motion Policy:フローマッチングモデルによるマニピュレーターの動作計画
arXiv:2604.
研究者ら、より効率的な動画推論に向けてOPDを応用
2本の論文が、蒸留技術を用いて小型モデルやストリーミング型の動画理解モデルの改善を図っている。
研究者ら、LLMエージェントの不確実性を評価するRUPAを提案
このフレームワークは、局所的なステップだけでなく、エージェントの軌跡全体にわたって信頼度を推定する。
長期的なLLMエージェント訓練を狙う新論文群
研究者らが、エージェントの信用割り当て、ルーティング、ファインチューニングに向けてTRCA、RLCascadeRouter、Agentic ESOptを提案。
新研究がエージェント型AIのサービング需要を可視化
4本の論文が、エージェント型LLMワークロードにおけるレイテンシ、キャッシング、トレース、エッジサービングを検証した。
グラフニューラルネットワークを1つの層方程式で統一する論文
このフレームワークは、GNNアーキテクチャを7つの計算コンポーネントに整理する。
研究者ら、構成的な画像・動画編集に照準
新たな論文群が、生成と編集を統合するモデルに向けた学習データと蒸留手法を提案している。
StartupBench、スタートアップ業務フローでエージェントを検証
市場で支持を得たAI製品に由来するエンドツーエンドのエージェント業務を評価するベンチマーク。
研究者ら、エージェント型3D制作向けのaDSLを提案
論文は、エージェントに焦点を当てた3D言語と、学習不要のマルチエージェントワークフローを組み合わせている。
Abra研究、拡散画像モデルの学習におけるスケーリング則を分析
HF Daily Papersが、テキスト画像生成の拡散モデルを対象にした計算量スケーリング研究を取り上げた。
GS-Voxel、大規模な空撮3DGS生成を狙う
このフレームワークは、事前最適化済みの3D Gaussianシーンを、シーンごとのフィッティングなしに疎な構造化潜在表現へ変換する。
画像生成に向けた能力中心のデータ設計を提案する論文
このフレームワークは、画像生成の訓練データを能力間の依存関係に基づいて整理する。
研究者ら、自律的な科学研究を評価するASI-Benchを発表
このベンチマークは、60件の研究タスクを通じて、革新的な探索能力と科学的実行力を検証する。
DeepSeek Harnessのプロンプトインジェクション耐性を検証
HF Daily Papersの要約によると、16の間接コンテンツチャネルで14,560件の制御実行を実施。
記憶ベースの身体化ナビゲーションを狙う新論文
UniWMとTAMP-Navは、ナビゲーションエージェントにおける視覚予測、記憶、行動の整合に向けた異なる手法を提案している。
EditBridge、超高解像度の画像編集を狙う
diffusion bridge手法は、低解像度編集を高精細化しながら元画像の細部を保つことを目指す。
研究者ら、ビジョン処理とデコードにおけるMoEのレイテンシ削減を狙う
新たな論文群が、MoEビジョンエンコーダ、小バッチデコードの高速化、オンライン負荷分散を提案している。
InternLM、Mobiusモデルアーキテクチャを提案
arXiv論文は、メモリと推論を分離することで圧縮と推論効率の向上を狙う。
R^3-Bench、共有予算下でのLLM推論を検証
このベンチマークは、計算資源を制約した問題セットで6つのモデルを評価する。
ClawGym II、エージェントハーネス向けブラックボックスRLに照準
この論文は、複雑なハーネスを介してエージェントを訓練するための、サンドボックス化されたロールアウトと軌跡復元を提案している。
GenRouter、画像生成プロンプトを低コストなワークフローへ振り分け
このフレームワークはエージェント型画像生成パイプラインを標準化し、タスクの要求に応じてプロンプトをルーティングする。
Ventor-QTest、ベンダーがホストするLLM APIを監査
この論文は、ホスト型open-weightモデルAPIにおける忠実度低下を検証するためのブラックボックス手法を提案している。
HarnessEval-W、ワールドモデル評価にエージェントベースのテストを追加
このベンチマークパイプラインは、サブエージェントを使って、検証可能な推論チェーンとともにロールアウトを評価する。
ピクセル空間の拡散モデルをより高速に訓練する研究
HF Daily Papersが、テキスト画像生成の拡散モデル訓練に向けた潜在空間からピクセル空間への手法を紹介。
AnyTalk、アニメーションデータなしで発話アニメーションを生成
動画拡散モデルを応用し、リップシンクした3Dキャラクターの発話アニメーションを作成する手法。
HiFi-BRep、より堅牢なB-Rep生成を目指す
このフレームワークは、トポロジーを考慮したエンコーディングと並列デコーディングにより、CADの境界表現を改善する。
GRNEdit、軽量な指示ベース動画編集を提案
この論文は、動画編集をバイナリ視覚コード上の「保持」か「反転」かの判断として捉えている。
研究者ら、拡散モデルをピクセル空間へ押し広げる
2本の論文が、画像復元とテキストからの画像生成に向けたピクセル空間拡散手法を提案した。
AI開発者ツールと実践をめぐりHacker Newsで議論
MathCode、AIコーディングの習慣、Cloudflare、GoogleのHEIRに関する投稿が議論を呼んだ。
Google、準同型暗号でプライベートAIを前進
Googleは、準同型暗号を活用してプライベートAIをより実用的にしようとしていると説明している。
Google、プライベートAIの実用化を進めていると説明
Google Securityの投稿がHacker Newsで議論を呼び、AI全般への批判とも並んだ。
研究者ら、LLMを制御下で研究するためのLittleLearnerを公開
50億パラメータのモデルは、小学5年生以下のカリキュラムに基づく880億トークンのコーパスで訓練された。
HNでAIの限界、プライバシー、科学的主張をめぐり議論
創薬、数学、プライバシー、AIラボに関する投稿がHacker Newsで活発な議論を呼んだ。
科学と仕事におけるAIの主張を新たな報告が検証
Hacker Newsで、創薬、数学、ChatGPT利用をめぐるAIの根拠に関する議論が注目された。
研究者ら、VLMの空間推論の弱点に照準
新たな論文群が、視覚言語システムの空間知能に向けて、記憶、RL、ベンチマークを提案している。
Google、コーディングとエージェント向けにGemini 3.7 Flashを発表
新しいFlashモデルは、Gemini API、Google AI Studio、Android Studio、企業向けツールで利用できる。
新研究、視覚AIの空間知能を検証
SpaRRTa、SMA、PinpointQAは、視覚AIや身体性AIシステムの空間推論を評価・改善する。
CW-BASS v2、DINOv2による疑似ラベル選別を標的に
基盤モデル教師の下で、半教師ありセグメンテーション向けのフィルタリングを適応させる手法。
Anthropicの研究、AIエージェントが共同タスクで衝突し得ると指摘
研究者らは、マルチエージェントの振る舞いが現行のAI安全性テストの盲点を浮き彫りにする可能性があるとしている。
研究者ら、映像の反射除去に向けた拡散モデルを提案
S2Rは、物理ベースの反射シミュレーションと、拡散型の映像除去モデルおよびベンチマークを組み合わせる。
論文、エージェント安全性には実行時契約が必要と主張
arXiv論文は、自律型エージェントには訓練時のアラインメントだけでは不十分だとしている。
研究者ら、弱いモデル向けにAIが構築したハーネスを検証
より強力なモデルが推論時の足場を構築し、Theory-of-Mindベンチマークで弱いモデルのスコアを引き上げた。
身体性エージェント向けハーネスを研究者らが検証
TheaとSHAPERは、コーディングエージェントのインフラ設計の考え方をロボットと身体性AIに応用する。
論文、LLMエージェントのGPU制御経路を検証
Ready Cohortsは、エージェント制御の処理がホストへ戻らずGPU上にとどまれる条件をモデル化する。
Mechanist、AIエージェントをモデル解釈可能性に投入
arXiv論文は、AIモデルにおける自律的なメカニズム発見を目指すエージェント型システムを説明している。