Домой Новости ИИ Anthropic выпустила Claude Opus 4.8: модель стала честнее о своих ошибках

Anthropic выпустила Claude Opus 4.8: модель стала честнее о своих ошибках

Новая версия ИИ-модели от Anthropic получила улучшенные агентские навыки и стала точнее оценивать собственные ошибки при выполнении сложных задач.

Компания Anthropic официально представила новую версию своей флагманской языковой модели — Claude Opus 4.8. Основное внимание в этом обновлении разработчики уделили не только увеличению вычислительной мощности, но и качественным изменениям в поведении нейросети при выполнении длительных автономных задач.

Ключевые улучшения Claude Opus 4.8

Согласно заявлению компании, Claude Opus 4.8 превосходит предыдущую версию 4.7 по трем направлениям: точности интерпретации сложных запросов, честности при оценке собственных возможностей и качестве удержания контекста в режиме агента, когда модель работает без участия пользователя.

Особое значение инженеры уделили работе в агентских сценариях. Ранее распространенной проблемой ИИ была склонность модели «галлюцинировать» об успешном завершении задачи, даже если она зашла в тупик или допустила ошибку на промежуточном этапе. Новое обновление внедряет механизм «более честной оценки прогресса», что должно значительно снизить количество ложных отчетов о выполнении поручений.

Anthropic выпустила Claude Opus 4.8: модель стала честнее о своих ошибках
Anthropic выпустила Claude Opus 4.8: модель стала честнее о своих ошибках — иллюстрация к материалу. Источник: ixbt.com

Технические показатели и бенчмарки

Рост возможностей модели подтверждается результатами в профильных тестах:

  • SWE-Bench Pro: оценка способности модели исправлять реальные баги в коде. Claude Opus 4.8 продемонстрировала 69,2% успеха против 64,3% у предшественницы. Для сравнения, показатель OpenAI GPT-5.5 в этом испытании составляет 58,6%.
  • OSWorld: тестирование навыков управления операционной системой. Результат новинки составил 83,4%.
  • GDPval-AA: бенчмарк сложной интеллектуальной работы, где модель набрала 1890 баллов против 1753 баллов у версии 4.7.

Несмотря на общий прогресс, в узкоспециализированной нише терминального программирования лидерство сохраняет OpenAI GPT-5.5 с показателем 78,2%, в то время как Claude Opus 4.8 остановилась на отметке 74,6%. Тем не менее, разрыв между конкурентами продолжает стремительно сокращаться.

Стоимость и рыночные перспективы

Важным аспектом для разработчиков и корпоративного сектора является сохранение прежних цен на API-доступ к модели. Отсутствие повышения стоимости при росте интеллектуальных возможностей делает переход на новую версию экономически выгодным для масштабируемых сервисов.

Текущий релиз подчеркивает важную тенденцию индустрии: фокус разработчиков смещается от бесконечной погони за «качеством текста» к созданию устойчивых цифровых агентов, способных эффективно выполнять многоэтапные цепочки действий и критически оценивать результаты своего труда.

Источник: https://www.ixbt.com