Що стосується кодингу та роботи з даними, то за бенчмарками Frontier-Bench та GDPval-AA, Opus 5 показує навіть кращі результати, ніж інші топові ШІ-моделі Anthropic, хоча все ще відстає від Mythos 5 у завданнях кібербезпеки.

Читайте также: Midjourney придбала астрологічний застосунок Co-Star. Навіщо їй це

Значно вища продуктивність за Opus 4.8

Компанія звертає увагу на те, що Claude Opus 5 забезпечує значно покращену продуктивність за ту ж ціну, що й його попередник, Opus 4.8. 

Зокрема, Opus 5 чудово справляється з завданнями розробки програмного забезпечення. 

Наприклад, у Frontier-Bench v0.1 нова ШІ-модель перевершує всі інші моделі та більш ніж удвічі — Opus 4.8. При цьому вона вимагає менше витрат на виконання завдань. У CursorBench 3.2 модель показує результати в межах 0,5% від пікового балу Fable 5. 

Водночас, у оцінюванні ARC-AGI 3, бал Opus 5 був утричі вищим, ніж у наступної моделі. На Zapier AutomationBench, який вимірює, чи можуть моделі виконувати бізнес-завдання від початку до кінця, коефіцієнт успішної роботи Opus 5 приблизно в 1,5 раза вищий, ніж у наступної найкращої моделі зі списку. 

«Навіть за найнижчих налаштувань зусиль Opus 5 виконує більше завдань, ніж будь-яка інша модель. У OSWorld 2.0 Opus 5 перевершує будь-яку іншу модель незалежно від ціни, перевершуючи найкращий результат Fable 5 за трохи більше ніж третину вартості», — зазначається в блозі Anthropic. 

Це також найкраща та найекономічніша модель компанії за результатами кількох пов’язаних оцінок:

Читайте также: YouTube заблокував в Україні канали підсанкційних артистів рф

  • ARC-AGI 3
  • GDPval-AA версії 2
  • OSWorld 2.0
  • HLE
  • AutomationBench
  • DeepSearchQA

Opus 5 демонструє суттєво кращі результати, ніж Opus 4.8, для наукових досліджень. Зокрема, це стосується структурної біології, органічної хімії та біоінформатики. 

Також ШІ-компанія продемонструвала, як модель справляється зі створенням складних візуальних ефектів. 

Що стосується кібербезпеки, то Opus 5 знаходить вразливості у вихідному коді, але водночас блокує сканування вразливостей на основі бінарних файлів (метод, який частіше пов’язують зі зловмисниками), тестування на проникнення та створення експлойтів.

Ціни на нову модель 

Claude Opus 5 доступний сьогодні на всіх платформах за ціною $5 за мільйон вхідних токенів та $25 за мільйон вихідних токенів. Розробники можуть розпочати роботу з claude-opus-5 на Claude API.

Нагадаємо, що на початку липня Anthropic представила «найбільш агентну модель» з усіх існуючих в цій лінійці — Claude Sonnet 5. 

Читайте также: Лайфхак від Андрей Карпати, як отримувати кращі відповіді від ШІ: просто базікайте з ним 10 хвилин

Від admin

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *