AAI News Hub

研究

60

研究

HarnessRisk、エージェント・ハーネスの安全性障害をベンチマーク

このベンチマークは、エージェント・ハーネスの各フェーズにおける攻撃を検証する。一方、関連研究ではタスクごとのプロビジョニングが検討されている。

arXiv cs.AI+1 outlet·21h ago
研究

Agent Lightning v1.0、ハーネス型エージェントRLを照準に

このフレームワークは、任意のエージェント・ハーネスを強化学習によるポストトレーニングに接続する。

arXiv cs.AI+1 outlet·21h ago
研究

論文、LLMのクロスモデル記憶転移を検証

研究者らは、学習済みの固定メモリをターゲット側リーダーを使って異なるモデル基盤間で移せるかを調べた。

arXiv cs.AI+1 outlet·21h ago
研究

DiSCO、ブラックボックス型text-to-imageの安全性に照準

arXiv論文は、モデルへのアクセスなしにNSFW出力を減らすプロンプトレベルの最適化を提案している。

arXiv cs.AI+1 outlet·21h ago
研究

PTXBench、LLMのGPUカーネル最適化能力を検証

このベンチマークは、H100およびB200 GPU上のGEMMとattentionワークロードで、アーキテクチャ固有のPTX活用を評価する。

arXiv cs.AI+1 outlet·21h ago
研究

研究者ら、エージェント・ハーネス向けRLフレームワークを提案

LEGO-RLとClawGym IIは、長期タスクに取り組むAIエージェントの強化学習を安定させることを狙う。

arXiv cs.AI+1 outlet·21h ago
研究

FACET、ターミナルタスク合成の一貫性向上を狙う

このフレームワークは、ターミナルエージェントの訓練に使う実行可能環境を構築・修復する。

HF Daily Papers·1d ago
研究

SkillForge、リポジトリ固有のスキルでエージェントを訓練

このフレームワークは、プロジェクトの課題を合成し、将来のソフトウェア修正に再利用できる知識を抽出する。

HF Daily Papers·1d ago
研究

IBM、AIエージェントに必要なメモリ量を検証

ALTK-Evolveの研究で、エージェントのメモリ効果はモデルの性能と提供方法に左右されることが示された。

Hugging Face·1d ago
研究

研究者ら、トラックとドローンの配送経路問題「TTP-D」を提案

新たなベンチマークは、品目選択、積載量に応じた経路設計、ドローンとの同期を組み合わせたものだ。

arXiv cs.AI+1 outlet·1d ago
研究

監査・修復の文脈でLLMチェッカーがより寛容になるとの研究結果

arXiv論文は、モデルの文脈内に過去の監査・修復エピソードがあると誤警報が減ると報告している。

arXiv cs.AI+1 outlet·1d ago
研究

AlphaEvolve、行列乗算の上界を引き下げ

新たなarXivノートが、行列乗算指数の上界を改善したと報告した。

arXiv cs.AI+1 outlet·1d ago
研究

習得済みではなく、まだ残された部分を学ぶ:複数報酬の方策最適化に向けた飽和度を考慮した優位性の再重み付け

arXiv:2608.

arXiv cs.AI+1 outlet·1d ago
研究

TRACE-Bench、複数参照画像生成を対象に

このベンチマークは、プロンプトを4つの演算子に分解し、モデルの失敗要因を診断する。

arXiv cs.AI+1 outlet·1d ago
研究

Flow Motion Policy:フローマッチングモデルによるマニピュレーターの動作計画

arXiv:2604.

arXiv cs.AI+1 outlet·1d ago
研究

研究者ら、より効率的な動画推論に向けてOPDを応用

2本の論文が、蒸留技術を用いて小型モデルやストリーミング型の動画理解モデルの改善を図っている。

arXiv cs.AI+1 outlet·1d ago
研究

研究者ら、LLMエージェントの不確実性を評価するRUPAを提案

このフレームワークは、局所的なステップだけでなく、エージェントの軌跡全体にわたって信頼度を推定する。

arXiv cs.CL+1 outlet·1d ago
研究

長期的なLLMエージェント訓練を狙う新論文群

研究者らが、エージェントの信用割り当て、ルーティング、ファインチューニングに向けてTRCA、RLCascadeRouter、Agentic ESOptを提案。

arXiv cs.AI+1 outlet·1d ago
研究

新研究がエージェント型AIのサービング需要を可視化

4本の論文が、エージェント型LLMワークロードにおけるレイテンシ、キャッシング、トレース、エッジサービングを検証した。

arXiv cs.AI+1 outlet·1d ago
研究

グラフニューラルネットワークを1つの層方程式で統一する論文

このフレームワークは、GNNアーキテクチャを7つの計算コンポーネントに整理する。

arXiv cs.LG+1 outlet·1d ago
研究

研究者ら、構成的な画像・動画編集に照準

新たな論文群が、生成と編集を統合するモデルに向けた学習データと蒸留手法を提案している。

arXiv cs.CL+1 outlet·1d ago
研究

StartupBench、スタートアップ業務フローでエージェントを検証

市場で支持を得たAI製品に由来するエンドツーエンドのエージェント業務を評価するベンチマーク。

HF Daily Papers+1 outlet·2d ago
研究

研究者ら、エージェント型3D制作向けのaDSLを提案

論文は、エージェントに焦点を当てた3D言語と、学習不要のマルチエージェントワークフローを組み合わせている。

HF Daily Papers·2d ago
研究

Abra研究、拡散画像モデルの学習におけるスケーリング則を分析

HF Daily Papersが、テキスト画像生成の拡散モデルを対象にした計算量スケーリング研究を取り上げた。

HF Daily Papers·2d ago
研究

GS-Voxel、大規模な空撮3DGS生成を狙う

このフレームワークは、事前最適化済みの3D Gaussianシーンを、シーンごとのフィッティングなしに疎な構造化潜在表現へ変換する。

HF Daily Papers·2d ago
研究

画像生成に向けた能力中心のデータ設計を提案する論文

このフレームワークは、画像生成の訓練データを能力間の依存関係に基づいて整理する。

HF Daily Papers+1 outlet·2d ago
研究

研究者ら、自律的な科学研究を評価するASI-Benchを発表

このベンチマークは、60件の研究タスクを通じて、革新的な探索能力と科学的実行力を検証する。

HF Daily Papers+1 outlet·2d ago
研究

DeepSeek Harnessのプロンプトインジェクション耐性を検証

HF Daily Papersの要約によると、16の間接コンテンツチャネルで14,560件の制御実行を実施。

HF Daily Papers·2d ago
研究

記憶ベースの身体化ナビゲーションを狙う新論文

UniWMとTAMP-Navは、ナビゲーションエージェントにおける視覚予測、記憶、行動の整合に向けた異なる手法を提案している。

HF Daily Papers+1 outlet·2d ago
研究

EditBridge、超高解像度の画像編集を狙う

diffusion bridge手法は、低解像度編集を高精細化しながら元画像の細部を保つことを目指す。

HF Daily Papers·2d ago
研究

研究者ら、ビジョン処理とデコードにおけるMoEのレイテンシ削減を狙う

新たな論文群が、MoEビジョンエンコーダ、小バッチデコードの高速化、オンライン負荷分散を提案している。

HF Daily Papers+1 outlet·2d ago
研究

InternLM、Mobiusモデルアーキテクチャを提案

arXiv論文は、メモリと推論を分離することで圧縮と推論効率の向上を狙う。

r/LocalLLaMA+1 outlet·2d ago
研究

R^3-Bench、共有予算下でのLLM推論を検証

このベンチマークは、計算資源を制約した問題セットで6つのモデルを評価する。

HF Daily Papers+1 outlet·3d ago
研究

ClawGym II、エージェントハーネス向けブラックボックスRLに照準

この論文は、複雑なハーネスを介してエージェントを訓練するための、サンドボックス化されたロールアウトと軌跡復元を提案している。

HF Daily Papers+1 outlet·3d ago
研究

GenRouter、画像生成プロンプトを低コストなワークフローへ振り分け

このフレームワークはエージェント型画像生成パイプラインを標準化し、タスクの要求に応じてプロンプトをルーティングする。

HF Daily Papers·3d ago
研究

Ventor-QTest、ベンダーがホストするLLM APIを監査

この論文は、ホスト型open-weightモデルAPIにおける忠実度低下を検証するためのブラックボックス手法を提案している。

HF Daily Papers+1 outlet·3d ago
研究

HarnessEval-W、ワールドモデル評価にエージェントベースのテストを追加

このベンチマークパイプラインは、サブエージェントを使って、検証可能な推論チェーンとともにロールアウトを評価する。

HF Daily Papers·3d ago
研究

ピクセル空間の拡散モデルをより高速に訓練する研究

HF Daily Papersが、テキスト画像生成の拡散モデル訓練に向けた潜在空間からピクセル空間への手法を紹介。

HF Daily Papers·3d ago
研究

AnyTalk、アニメーションデータなしで発話アニメーションを生成

動画拡散モデルを応用し、リップシンクした3Dキャラクターの発話アニメーションを作成する手法。

HF Daily Papers·3d ago
研究

HiFi-BRep、より堅牢なB-Rep生成を目指す

このフレームワークは、トポロジーを考慮したエンコーディングと並列デコーディングにより、CADの境界表現を改善する。

HF Daily Papers·3d ago
研究

GRNEdit、軽量な指示ベース動画編集を提案

この論文は、動画編集をバイナリ視覚コード上の「保持」か「反転」かの判断として捉えている。

HF Daily Papers+1 outlet·3d ago
研究

研究者ら、拡散モデルをピクセル空間へ押し広げる

2本の論文が、画像復元とテキストからの画像生成に向けたピクセル空間拡散手法を提案した。

HF Daily Papers·3d ago
研究

AI開発者ツールと実践をめぐりHacker Newsで議論

MathCode、AIコーディングの習慣、Cloudflare、GoogleのHEIRに関する投稿が議論を呼んだ。

Hacker News+5 outlets·3d ago
研究

Google、準同型暗号でプライベートAIを前進

Googleは、準同型暗号を活用してプライベートAIをより実用的にしようとしていると説明している。

Hacker News+8 outlets·3d ago
研究

Google、プライベートAIの実用化を進めていると説明

Google Securityの投稿がHacker Newsで議論を呼び、AI全般への批判とも並んだ。

Hacker News+5 outlets·3d ago
研究

研究者ら、LLMを制御下で研究するためのLittleLearnerを公開

50億パラメータのモデルは、小学5年生以下のカリキュラムに基づく880億トークンのコーパスで訓練された。

r/LocalLLaMA+1 outlet·3d ago
研究

HNでAIの限界、プライバシー、科学的主張をめぐり議論

創薬、数学、プライバシー、AIラボに関する投稿がHacker Newsで活発な議論を呼んだ。

Hacker News+11 outlets·4d ago
研究

科学と仕事におけるAIの主張を新たな報告が検証

Hacker Newsで、創薬、数学、ChatGPT利用をめぐるAIの根拠に関する議論が注目された。

Hacker News+2 outlets·4d ago
研究

研究者ら、VLMの空間推論の弱点に照準

新たな論文群が、視覚言語システムの空間知能に向けて、記憶、RL、ベンチマークを提案している。

arXiv cs.AI+1 outlet·4d ago
研究

Google、コーディングとエージェント向けにGemini 3.7 Flashを発表

新しいFlashモデルは、Gemini API、Google AI Studio、Android Studio、企業向けツールで利用できる。

Hacker News+13 outlets·5d ago
研究

新研究、視覚AIの空間知能を検証

SpaRRTa、SMA、PinpointQAは、視覚AIや身体性AIシステムの空間推論を評価・改善する。

arXiv cs.LG+1 outlet·5d ago
研究

CW-BASS v2、DINOv2による疑似ラベル選別を標的に

基盤モデル教師の下で、半教師ありセグメンテーション向けのフィルタリングを適応させる手法。

arXiv cs.LG+1 outlet·5d ago
研究

Anthropicの研究、AIエージェントが共同タスクで衝突し得ると指摘

研究者らは、マルチエージェントの振る舞いが現行のAI安全性テストの盲点を浮き彫りにする可能性があるとしている。

TechCrunch AI·6d ago
研究

研究者ら、映像の反射除去に向けた拡散モデルを提案

S2Rは、物理ベースの反射シミュレーションと、拡散型の映像除去モデルおよびベンチマークを組み合わせる。

arXiv cs.AI+1 outlet·6d ago
研究

論文、エージェント安全性には実行時契約が必要と主張

arXiv論文は、自律型エージェントには訓練時のアラインメントだけでは不十分だとしている。

arXiv cs.AI+1 outlet·6d ago
研究

研究者ら、弱いモデル向けにAIが構築したハーネスを検証

より強力なモデルが推論時の足場を構築し、Theory-of-Mindベンチマークで弱いモデルのスコアを引き上げた。

arXiv cs.AI+1 outlet·6d ago
研究

身体性エージェント向けハーネスを研究者らが検証

TheaとSHAPERは、コーディングエージェントのインフラ設計の考え方をロボットと身体性AIに応用する。

arXiv cs.AI+1 outlet·6d ago
研究

論文、LLMエージェントのGPU制御経路を検証

Ready Cohortsは、エージェント制御の処理がホストへ戻らずGPU上にとどまれる条件をモデル化する。

arXiv cs.AI+1 outlet·6d ago
研究

Mechanist、AIエージェントをモデル解釈可能性に投入

arXiv論文は、AIモデルにおける自律的なメカニズム発見を目指すエージェント型システムを説明している。

arXiv cs.AI+1 outlet·6d ago