GitHub представи ReviewBench — отворен бенчмарк за оценка на AI агенти, които преглеждат промени в програмен код. Според компанията целта е различните системи да бъдат сравнявани върху задачи, близки до реалната работа с pull request-и, вместо върху малък демонстрационен набор.

Корпусът включва 219 публични pull request-а от 187 хранилища с отворен лиценз и обхваща 19 програмни езика. GitHub посочва, че разпределението по език и размер на хранилището е моделирано след анализ на 103,9 милиона pull request-а, докато размерът на самите промени умишлено е изместен към по-съдържателни случаи за преглед.

Референтният набор от находки е събран от реални човешки рецензенти, последващи корекции на авторите, инструменти за детерминистичен анализ и няколко големи езикови модела. Припокриващите се сигнали се обединяват семантично, а всяка находка се оценява по общ критерий за вярност, уместност и нетривиалност.

ReviewBench отчита шест показателя в две групи: grounded precision, recall и F1 спрямо вече известните находки, както и augmented precision, recall и F1, при които се оценяват и нови проблеми извън референтния набор. Резултатите могат да се разглеждат и по тежест и категория, а параметърът beta във F-beta позволява различен баланс между прецизност и пълнота.

Преди публикуването старши инженери, които не са участвали в изграждането на набора, са означили независимо референтните находки. GitHub съобщава за 96,6% съвпадение между техните оценки и етикетите в ReviewBench, като версионира набора от данни, оценяващия модел и механизма за съпоставяне.

Компанията е използвала бенчмарка и при разработката на Copilot code review. В описан експеримент ReviewBench и последвалият онлайн A/B тест са показали еднаква посока на промяна за прецизност, пълнота, брой коментари и цена на преглед, но GitHub подчертава, че производствените експерименти остават окончателната мярка за ефекта върху потребителите.

Изследователската версия е достъпна чрез сайта на ReviewBench с публичен набор от данни, методика, конфигурация на оценяването и табло за сравнение. Желаещите да изпитат собствен агент могат да го регистрират, да направят тест върху 25 pull request-а и след това да подадат пълен прогон върху 219 случая в три кръга.