Anthropic випустила Claude Sonnet 5.5: нейромережа працює на третину швидше і дихає в спину флагману Opus

Компанія Anthropic представила Claude Sonnet 5.5 — нову модель середнього рівня в актуальній лінійці алгоритмів. Реліз вийшов незвичним: замість того щоб просто знизити ціни на API, розробники зробили ставку на внутрішню оптимізацію. Модель генерує відповіді на 30% швидше за попередницю Sonnet 5, а за якістю програмування та роботи з агентами впритул наблизилася до флагманської Opus 5.5.
Формально тарифи на використання Sonnet 5.5 залишилися незмінними: 2 долари за мільйон вхідних токенів і 10 доларів за мільйон вихідних. Для порівняння, запити до потужної Opus 5.5 коштують рівно вдвічі дорожче. Втім, як зазначає VentureBeat, реальна вартість виконання комплексних завдань знизилася приблизно на 30%. Економія досягається завдяки порозумнішалій архітектурі: нейромережа рідше помиляється, витрачає менше токенів на міркування і рідше смикає зовнішні інструменти, щоб отримати правильну відповідь.
Агентне програмування та конкуренція з GPT-6 Sol
Найбільший стрибок продуктивності стався в написанні коду та виконанні автономних команд. У профільному агентному тесті Terminal-Bench 4.0 нова модель показала 70,6% успішних дій, розгромивши не лише минулу Sonnet 5 (10,3%), а й флагманську Opus 5.5 (66,4%).
У завданнях для професійної роботи розрив між середнім і старшим класом також майже стерся. За даними видання The Decoder, у тестуванні GDPval-AA новинка набрала 1844 бали, поступившись Opus 5.5 лише два очки.
На тлі таких результатів у спільноті розробників почали називати Sonnet 5.5 «вбивцею» нещодавно випущеної GPT-6 Sol від OpenAI. Утім, це перебільшення. Алгоритм Anthropic справді перевершує конкурента за низкою метрик (наприклад, у тому ж GDPval-AA рахунок 1844 проти 1487 у Sol), але в тесті FrontierCode за максимальних витрат на міркування (reasoning effort) GPT-6 Sol все ще попереду з результатом 49,3% проти 46,2%. Моделі йдуть нарівні, по черзі виграючи в різних сценаріях використання.
Екосистема та контекстне вікно на мільйон токенів

Сама Anthropic позиціонує Sonnet 5.5 як робочу конячку для повсякденного кодингу, рефакторингу, аналізу документів і таблиць. Найскладніші завдання з високим ступенем невизначеності, як і раніше, радять делегувати важковаговій Opus 5.5.
Модель уже доступна у вебінтерфейсі Claude і через API. Партнери компанії також оперативно інтегрували новинку: у документації Google Cloud зазначено, що Sonnet 5.5 підтримує масивне контекстне вікно до 1 мільйона токенів і здатна видавати до 128 тисяч токенів за одну відповідь. У день релізу модель також стала доступною користувачам платних тарифів GitHub Copilot.
Sonnet 5.5 стала другою нейромережею актуального покоління Anthropic — флагман Opus 5.5 вийшов тижнем раніше, 22 вересня. Наступним кроком компанії стане реліз полегшеної Claude Haiku 5.5, орієнтованої на швидку обробку масових запитів.