テストを通っても3件に1件はレビュー失格。SWE-Gateが示したコードエージェント評価の盲点
機能テストを通ったAIの修正でも、34.3%がレビュー由来の…
機能テストを通ったAIの修正でも、34.3%がレビュー由来の…
AIエージェントの途中経過から成功と失敗を予測し、開発中の評…
長期開発は、同じエージェントを長く動かすだけでは前へ進みませ…
研究計画には一つの正解がありません。PaperGymは問題と…
同じ381タスクでも、現実らしい短い依頼ではコーディングAI…
6種類の採点AIを集めても、難しいツール呼び出しでは同じ盲点…
質問すれば78.8%答えられるのに、自然な会話で事実に触れた…
2,269件の実PRで、AIの欠陥検出F1は最高でも0.55…
大型モデルには圧縮文脈、小型モデルには完全文脈。AsymSp…
安いモデルから高性能モデルへ替えても、生の履歴を渡すだけでは…