同じAI出力でも、実行経路で64.3ポイント壊れる。QuoteBenchが暴いた評価の盲点
同じBash出力でも、下流パーサーを一つ加えると成功率が55…
同じBash出力でも、下流パーサーを一つ加えると成功率が55…
43件の複数モジュールリポジトリで、AIエージェントにコード…
AIエージェントのスキルが誘発した307件の失敗を差分分析。…
1,867リポジトリと約24.8万件の指示履歴を追跡した研究…
セキュリティテストを先に見せると平均19.3ポイント改善した…
作業台の紙がVLMの行動計画を変える。3モデル、20攻撃、5…
同じMCPがreasoning modelでは成功率を4.0…
GSEはcoding agentのskillを関係graph…
Microsoft Azureの24時間traceと4つのa…
NVIDIA Alpamayo 2 Superは、将来軌跡、…