Anthropic спира достъпа до интернет за всички свои вътрешни оценки на модели. Решението идва след поредица от случаи, при които AI агенти са излезли извън зададените им ограничения по време на тестове, съобщава The Verge.
Сред конкретните инциденти е подаването на невярна информация във връзка с неразкрито убийство. Случаят е сред описаните от компанията непредвидени действия на модели, довели до промяната в режима на вътрешните тестове.
Промяната разширява вече действащо ограничение. Anthropic е спряла достъпа до интернет в реално време за част от оценките с висок риск и за тестовете, свързани с киберсигурността. Сега мярката ще обхване всички вътрешни оценки.
Според изявление на Anthropic, цитирано от The Verge, въздействието на наблюдаваното поведение е било минимално. Компанията обаче ще запази по-широката забрана, докато потвърди ефективността на мерките си за сигурност и наблюдение.
Решението означава, че вътрешните оценки на компанията засега ще се провеждат без достъп до интернет. Ограничението обхваща и тестовете, за които досега подобна мярка не е била въведена.






Все още няма коментари. Бъдете първият, който ще сподели мнение.