公開テスト96.64%でも完全成功47.90%。SWE-bench Scienceが暴いた科学コード修復の落とし穴
公開テストでは96.64%でも完全成功は47.90%。119…
公開テストでは96.64%でも完全成功は47.90%。119…
評価できない正解と誤答の組を、次の検査ルール作成へつなげるE…
長時間のOffice作業100件で、GUIだけのAIはなぜ崩…
AIに実装より先にテストを書かせ、実行結果から両方を直すTD…
30B中3Bだけを動かすMoE、投機的デコード、NVFP4は…
45体の脆弱性探索は専門化を生む一方、共有キューでは240万…
同じBash出力でも、下流パーサーを一つ加えると成功率が55…
43件の複数モジュールリポジトリで、AIエージェントにコード…
AIエージェントのスキルが誘発した307件の失敗を差分分析。…
1,867リポジトリと約24.8万件の指示履歴を追跡した研究…