AMD Instinct MI455X змінює правила гри
Інтелектуальний стрибок Claude Opus 5

Реліз Claude Opus 5 відкриває нову сторінку в еволюції інструментів для професійної розробки та автоматизації. Anthropic позиціонує цю модель не просто як оновлення попередньої версії, а як повноцінний фундамент для створення довготривалих AI-агентів. Головним вектором розвитку стало підсилення «агентних» можливостей: тепер модель демонструє значно глибший підхід до верифікації власних результатів. Замість поверхневого виправлення помилок, Opus 5 прагне відшукати першопричину збою та продовжує ітеративну роботу над рішенням навіть після того, як перший робочий варіант було знайдено, щоб довести код до ідеалу.
Технічний прогрес підтверджується суворими метриками бенчмарків, де модель демонструє вражаючу динаміку. У тесті SWE-bench Pro, що імітує реальний робочий процес програміста над завданнями в репозиторіях, Opus 5 практично зрівнялася з Fable 5, показавши результат 79,2% проти 80%. Ще помітнішим є стрибок у FrontierBench v0.1: якщо попередня версія Opus 4.8 справлялася лише з 18,7% завдань, то нова модель підняла цей показник до 44,4%, що свідчить про якісну зміну здатності до складного планування.
Окремої уваги заслуговує успіх моделі в ARC-AGI-3 — тесті на здатність до узагальнення та розв'язання задач, із якими модель раніше не стикалася. Тут Opus 5 значно випередила GPT-5.6 Sol, набравши 30,16% проти 7,78%. Це вказує на серйозний прогрес у галузі чистого логічного виведення. Проте конкуренція залишається гострою: у DeepSWE модель все ще трохи поступається GPT-5.6 Sol (68,8% проти 72,7%), що підкреслює стале лідерство останніх розробок OpenAI у специфічних глибоких інженерних сценаріях.
Методологія тестування, описана в system card моделі, висвітлює важливий індустріальний тренд — використання адаптивного мислення (adaptive thinking). Anthropic застосовувала максимальний рівень зусиль (effort) при генерації відповідей та усереднювала результати за п'ятьма запусками. Фактично це означає перехід до парадигми «обчислень під час виведення» (inference-time compute), коли модель витрачає більше ресурсів на обдумування завдання перед видачею остаточної відповіді, що радикально підвищує точність у складних задачах.
Економічна стратегія Anthropic виглядає агресивно та прагматично. Вартість використання API залишилася на рівні Opus 4.8: 5 доларів за мільйон вхідних токенів і 25 доларів за мільйон вихідних. Таким чином, користувач отримує продуктивність рівня Fable 5, але при цьому витрати на інфраструктуру скорочуються удвічі. Для тих, кому критична швидкість, передбачено Fast mode, який працює приблизно у 2,5 раза швидше за стандартний режим, хоча й обходиться вдвічі дорожче. Такий підхід дозволяє гнучко балансувати між вартістю, часом відгуку та якістю інтелектуального виведення залежно від конкретного бізнес-кейсу.

