
Открываем твой цифровой клуб…
Игры и железо
Anthropic объявила о выпуске Claude Opus 5.5, новой языковой модели в линейке Claude 5.5, которую компания называет своим флагманом. По заявлению разработчика, новая версия должна значительно превзойти Opus 5 в задачах агентного программирования, работе с компьютером и прикладных офисных сценариях, при этом экономия на эксплуатации — примерно 40% в среднем. Также отмечается, что Opus 5.5 рассчитана на последовательные сложные задачи: планирование действий, использование инструментов, проверку промежуточных результатов и корректировку больших проектов.
В релизе предусмотрен так называемый ускоренный режим Fast Mode в Claude Code и Claude Platform, который обещает ускорение до 2,5 раза по сравнению с обычной скоростью. Компания подчеркивает усиленную защиту от ошибок и попыток выйти за пределы изолированной среды, а также более структурированные ответы и снижение использования жаргона для совместной работы с пользователем.
По данным тестирования внутри компании Opus 5.5 демонстрирует преимущества на ряде тестов, хотя представители Anthropic напоминают, что различия в бенчмарках и реальное преимущество не всегда точно соответствуют друг другу. Приведённые примеры включают миграцию кода и аудит баз: Opus 5.5 якобы обошла конкурентов по скорости и цене, при этом результаты в отдельных испытаниях оцениваются по-разному, и компания подчёркивает, что отдельные тесты не являются прямым прогнозом работы в реальных условиях.
В составе презентации приводятся конкретные цифры по сравнению с конкурентами: в тесте миграции 680 тысяч строк кода за один день вместо нескольких недель вручную, аудит 200 тысяч строк за менее чем три часа против более чем 20 часов на предыдущей версии; миграция HAProxy с C на Rust заняла 9,5 часа против 12 часов у Fable 5.1, а стоимость выполненной работы оказалась примерно на 51% ниже.
Дополнительные данные показывают, что Opus 5.5 опередила соперников в бенчмарках Terminal-Bench 4.0 и CursorBench 4.0 по части многошаговых задач и обработки командной строки, хотя Anthropic подчёркивает, что цифры в тестах не сами по себе определяют практическую ценность. В GDPval-AA v2.1 Opus 5.5 набрала 1846 очков против 1735 у Fable 5.1 и 1708 у Opus 5.
По данным компании, тесты на порог качества в области финансовых и юридических документов показывают устойчивость Opus 5.5: в 16 из 18 попыток модель соответствовала установленным критериям без провалов. В отдельных задачах также упоминается улучшенное структурирование ответов и сокращение жаргона, что должно упростить долговременную работу с пользователями. Для чувствительных запросов в сферах кибербезопасности и биологии ограничение доступа к более продвинутым релизам реализуется через перенаправление на другие версии, например Claude Opus 4.8.
Claude Opus 5.5 доступна через чат-бот Claude, API и другие сервисы Anthropic; к релизу планируются версии Claude Sonnet 5.5 и Claude Haiku 5.5 с теми же преимуществами по производительности, эффективности и безопасности.