Що стосується кодингу та роботи з даними, то за бенчмарками Frontier-Bench та GDPval-AA, Opus 5 показує навіть кращі результати, ніж інші топові ШІ-моделі Anthropic, хоча все ще відстає від Mythos 5 у завданнях кібербезпеки.
Читайте также: Midjourney придбала астрологічний застосунок Co-Star. Навіщо їй це
Значно вища продуктивність за Opus 4.8
Компанія звертає увагу на те, що Claude Opus 5 забезпечує значно покращену продуктивність за ту ж ціну, що й його попередник, Opus 4.8.
Зокрема, Opus 5 чудово справляється з завданнями розробки програмного забезпечення.
Наприклад, у Frontier-Bench v0.1 нова ШІ-модель перевершує всі інші моделі та більш ніж удвічі — Opus 4.8. При цьому вона вимагає менше витрат на виконання завдань. У CursorBench 3.2 модель показує результати в межах 0,5% від пікового балу Fable 5.
Водночас, у оцінюванні ARC-AGI 3, бал Opus 5 був утричі вищим, ніж у наступної моделі. На Zapier AutomationBench, який вимірює, чи можуть моделі виконувати бізнес-завдання від початку до кінця, коефіцієнт успішної роботи Opus 5 приблизно в 1,5 раза вищий, ніж у наступної найкращої моделі зі списку.
«Навіть за найнижчих налаштувань зусиль Opus 5 виконує більше завдань, ніж будь-яка інша модель. У OSWorld 2.0 Opus 5 перевершує будь-яку іншу модель незалежно від ціни, перевершуючи найкращий результат Fable 5 за трохи більше ніж третину вартості», — зазначається в блозі Anthropic.
Це також найкраща та найекономічніша модель компанії за результатами кількох пов’язаних оцінок:
Читайте также: YouTube заблокував в Україні канали підсанкційних артистів рф
- ARC-AGI 3
- GDPval-AA версії 2
- OSWorld 2.0
- HLE
- AutomationBench
- DeepSearchQA
Opus 5 демонструє суттєво кращі результати, ніж Opus 4.8, для наукових досліджень. Зокрема, це стосується структурної біології, органічної хімії та біоінформатики.
Також ШІ-компанія продемонструвала, як модель справляється зі створенням складних візуальних ефектів.
Що стосується кібербезпеки, то Opus 5 знаходить вразливості у вихідному коді, але водночас блокує сканування вразливостей на основі бінарних файлів (метод, який частіше пов’язують зі зловмисниками), тестування на проникнення та створення експлойтів.
Ціни на нову модель
Claude Opus 5 доступний сьогодні на всіх платформах за ціною $5 за мільйон вхідних токенів та $25 за мільйон вихідних токенів. Розробники можуть розпочати роботу з claude-opus-5 на Claude API.
Нагадаємо, що на початку липня Anthropic представила «найбільш агентну модель» з усіх існуючих в цій лінійці — Claude Sonnet 5.
Читайте также: Лайфхак від Андрей Карпати, як отримувати кращі відповіді від ШІ: просто базікайте з ним 10 хвилин
