Одна модель, разные результаты: как инфраструктура меняет бенчмарки ИИ-агентов

В этом году Anthropic опубликовала исследование инфраструктурного шума в бенчмарках для ИИ-агентов, которые пишут и запускают код. На Terminal-Bench 2.0 разница между самой строгой и неограниченной конфигурациями достигла шести процентных пунктов....
Читать полный текст в источникеhabr.com — habr.com
Материал собран автоматически из открытых RSS-источников. Пересказ приведён в информационных целях в соответствии со ст. 1274 ГК РФ с указанием первоисточника; полное воспроизведение не осуществляется. Мнения авторов оригинала не обязательно отражают позицию ООО «АЛТЕЯ». Все источники проверены по реестру СМИ-иноагентов Минюста РФ (255-ФЗ).