То, что сейчас происходит на рынке искусственного интеллекта — это просто безумие! Выход новой модели Claude Opus 5 перевернул все с ног на голову. Новинка не только обходит флагманскую модель Fable по большинству показателей, но и стоит ровно в два раза дешевле.
В этой статье мы подробно разберем результаты бенчмарков, поговорим о новой ценовой политике и выясним, почему эта нейросеть стала настоящим кошмаром для конкурентов, включая GPT 5.6 Soul.
Главные особенности и стоимость Opus 5
Opus 5 — это новейшая версия в линейке топовых моделей. Если вы помните, ранее Anthropic выпустили гигантскую модель Fable, которая казалась недосягаемой. Но Opus 5 не просто догнал её, он установил новые стандарты эффективности.
Модель уже доступна на всех платформах по невероятно привлекательной цене:
- Входящие токены: $5 за 1 миллион
- Исходящие токены: $25 за 1 миллион
Это та же цена, что и у предыдущего поколения Opus 4.8, в два раза дешевле Fable и сопоставимо с GPT 5.6 Soul.
Результаты бенчмарков: Opus 5 против всех
Цифры говорят сами за себя. Opus 5 демонстрирует колоссальный прирост производительности. Давайте посмотрим на сухие факты.
| Бенчмарк | Результат / Сравнение | Примечание |
| GDP val (OpenAI) | Прирост на 100 баллов | Тест на реальные практические задачи |
| Arc AGI 3 | 30% (прыжок с ~8%) | Огромный прорыв в решении нестандартных головоломок |
| Browse comp | 90% (против 87% у Fable) | Навигация и работа с браузером |
| OS World | Улучшение на 4 пункта | Управление компьютером (клики, поиск элементов на экране) |
| Automation Bench | Улучшение на 9 пунктов | Способности к автоматизации процессов |
| Deep Su | Небольшое снижение | Бенчмарк, отвечающий за "вайб" и общее восприятие модели |
| Legal Benchmark | Падение с 13.3 до 11.7 | Юридические задачи пока даются хуже |
Этот скачок в тесте Arc AGI 3 до 30% — это настоящий шок для индустрии. До этого лучшая в мире модель набирала там не больше 8%. Искусственному интеллекту дают совершенно новую игру без правил, и он должен сам понять, как в нее играть. Opus 5 справляется с этим в разы лучше любой другой нейросети.
"Стоимость за задачу" — новая главная метрика
Забудьте о стоимости за миллион токенов. Главный показатель, на который сегодня нужно обращать внимание — это Cost per Task (Стоимость за задачу).
Отличный пример — модель Kimmy K3. Она стоит в два раза дешевле GPT 5.6 Soul, но требует в два раза больше токенов для выполнения той же задачи. В итоге вы платите ту же цену.
Графики показывают, что Opus 5 сместился в зону абсолютной эффективности: модель демонстрирует высочайший процент успешного выполнения задач (Pass rate per task) при минимальных затратах. Для достижения аналогичных результатов на минимальных настройках GPT 5.6 Soul обойдется более чем в два раза дороже!
Тестирование корпоративных задач (Box AI)
Компания Box провела собственное масштабное тестирование Opus 5 на реалистичных задачах по работе с документами, с которыми ежедневно сталкиваются офисные сотрудники в 12 различных отраслях.
Ключевые улучшения по сравнению с Opus 4.8:
- Глубокая аналитика (Due Diligence): рост с 65 до 76 баллов.
- Составление отчетов на основе данных: рост с 67 до 69 баллов.
- Анализ данных: мощный скачок на 6 пунктов.
Opus 5 показывает явное преимущество в многоступенчатом анализе, который лежит в основе принятия реальных бизнес-решений.
Кибербезопасность и автоматические откаты (Fallbacks)
Интересная ситуация сложилась в сфере кибербезопасности. Opus 5 стал сильнее предыдущего поколения (Opus 4.8), но намеренно отстает от моделей без ограничений, таких как Mythos 5.
Успешность разработки эксплойтов:
- Mythos 5: 13 баллов
- Opus 5: 4 балла
- Opus 4.8: 0 баллов
Обычно, когда разработчики "навешивают" на модель строгие фильтры безопасности (Guardrails), её общая производительность сильно падает. Однако Anthropic совершили невозможное: они снизили хакерский потенциал модели, одновременно повысив её общее качество и логику.
Важный нюанс API: Если встроенные классификаторы безопасности сочтут ваш запрос подозрительным, API автоматически перенаправит (откатит) его на Opus 4.8. Вы заплатите цену модели отката, но такие переключения могут раздражать при работе со сложными промптами.
Вывод: Три лидера на Парето-фронте
Сегодня на так называемом "фронте Парето" — точке идеального баланса между высочайшим качеством и низкой стоимостью — закрепились всего три модели:
- Claude Opus 5 (Новый абсолютный лидер)
- GPT 5.6 Soul (Вероятно, последняя итерация перед GPT-6)
- Kimmy K3 (Мощное open-source решение)
Opus 5 — это невероятный инструмент на каждый день. Эксперты рекомендуют использовать его как основную рабочую лошадку, а при необходимости подключать Fable для сложнейшего планирования, мозговых штурмов или исправления самых запутанных багов в коде.
На основе Opus 5 is INSANE...
