Суть експерименту

Можна купити найдорожчу підписку на улюблений ШІ, грамотно прописати промпт і все одно отримати відповідь, яка не відповідає дійсності. Рівень кортизолу зростає, час до мітингу, де ти маєш презентувати дані, спливає, і ти починаєш згадувати всіх тих LinkedIn-інфлуенсерів із порадами та «100% робочими» промптами.

Читайте также: Айтівець створив iнструмент для QA, який прискорює аналіз падінь автотестів на pytest, Selenium та Playwright. Як працює Testinel

Як і всі маркетологи, я використовую ШІ для багатьох задач.Часто робота з ними більше виснажує, ніж дає справді класний результат. Тож я вирішив провести дослідження, а саме протестувати чотири найпопулярніші моделі GPT-5.5, Claude Opus 4.8, Gemini 3.1 Pro та Grok 4.3 і порівняти результати.

Я завантажив однакові датасети через Coupler.io: воронку, ICP-розбивки, аналіз відтоку, ефективність кампаній тощо. У режимі Agent (Medium) у Cursor я ставив десять запитань в однаковому порядку: знайти прогалини в даних, побудувати профілі клієнтів, проаналізувати воронку, оцінити ризик відтоку, порахувати втрачений дохід і запропонувати стратегічні рекомендації.

Аби середовище було ближчим до реального, я згодовував моделям дані, у яких подекуди бракувало чіткості: вони суперечили одне одному або не дозволяли зробити впевнений висновок. Саме це допомогло краще розгледіти поведінку кожної моделі та зрозуміти, коли яку варто використовувати.

Тож якщо цікаво побачити результати, ось що в мене вийшло.

На чому базуються висновки

Я, звісно, міг би поділитися результатами всіх десяти запитань. Але щоб не завалювати вас, зупинюся на трьох найцікавіших (насправді, обрати було складно). Саме на них найкраще видно розбіжності в поведінці моделей у популярних кейсах.

Тест 1. Чи визнає модель, що даних немає

Запитання: проаналізуй Q4 2025, а саме, які кампанії мають найвищу вартість залучення (CPA) відносно конверсії з пробного періоду в передплату? На яких із них варто скоротити витрати? (eng: Let’s analyze Q4 2025. Which campaigns have the highest CPA relative to their trial-to-paid conversion? Where should we cut spend?)

Тут перевірялося, чи здатна модель посеред задачі виявити прогалину в даних і все одно видати щось корисне: попрацювати з наявним, пояснити, чого бракує, і запропонувати конкретний наступний крок.

Що отримали:

GPT-5.5

  • Помітив нестачу даних і побудував ранжовану таблицю дій із кольоровими позначками (Cut / Cap / Tighten / Protect).
  • Мінус: рекомендації спиралися на показники конверсії, які сам же назвав ненадійними, не помітивши суперечності.

Gemini 3.1 Pro

  • Підтвердив прогалину в даних, знайшов потрібний датасет і запитав, до якої рекламної платформи підключитися.
  • Мінус: не запропонував жодного проміжного аналізу на основі вже доступної інформації.

Grok 4.3

  • Швидко помітив, що даних про витрати немає.
  • Ранжував сегменти за конверсією в оплату (e-commerce 8%, finance 4,5%) і порадив першими зменшувати «Finance» та «Analysts».
  • Стисло й корисно, але без візуалізації.

Claude Opus 4.8

  • Не сприйняв це як проблему з даними: знайшов витрати на рівні окремих кампаній і одразу відповів на запитання.
  • Виявив групу кампаній, спрямованих на конкурентів (52% бюджету Q4, жодної платної конверсії), і запропонував скоротити саме її.
  • порадив зберегти бюджет на Brand Search і звернув увагу на можливі артефакти атрибуції в даних Meta та LinkedIn.

Тест 3. Чи може працювати з комбінаціями джерел 

Запитання: які комбінації джерел даних найчастіше під’єднують наші e-commerce клієнти, і що саме корелює з найвищою конверсією в платних (eng: What are the most common data source combinations our e-commerce customers connect and which combos correlate with the highest paid conversion rate?)

Перевіряв, чи здатні моделі виявляти кореляцію між комбінаціями конекторів і платною конверсією, і чи можуть вони відрізняти обсяг (що найпоширеніше) від ефективності (що дає конверсію).

Читайте также: Український робот-бариста радить користувачам бігти в укриття під час тривоги та відмовляється готувати каву грубіянам. RoboL Robotics запустив першу робокав’ярню в ТЦ у Дніпрі

Що отримали:

GPT-5.5

  • Побудував повну панель (canvas).
  • Ключова знахідка: платна конверсія зростає з кількістю джерел. Одне дає 6,3%, три — 31,4%, пʼять і більше — 48,2%.
  • Найкраща стабільна комбінація: Facebook Ads + Google Ads + Google Analytics + Shopify = 45,5% (11 акаунтів); найпоширеніше окреме джерело: Shopify (238 акаунтів).

Gemini 3.1 Pro

  • Показав ті самі дані щодо комбінацій.
  • Додав аналіз ланцюжка «джерело → призначення», якого не було в GPT: Google Ads → BigQuery = 68,4%, Facebook Ads → BigQuery = 60,9%, Klaviyo → Claude = 53,8%.
  • Висновок: куди ти надсилаєш дані, важить не менше, ніж що ти підʼєднуєш.

Grok 4.3

  • Прописав текстом найпоширеніші джерела: Facebook Ads (545), Shopify (508), Google Ads (380).
  • Додав звʼязку Shopify + Facebook Ads + Google Ads — близько 49,6% конверсії.
  • Підкреслив: налаштування з кількома джерелами даних сигналізують про наміри у 7–8 разів сильніші, ніж одне джерело. Чистий аналіз, але без візуалізації.

Claude Opus 4.8

  • Відповів текстом, звузивши вибірку до e-commerce-організацій Q4 2025.
  • Платна конверсія зростає приблизно у 5 разів від одного джерела до трьох і більше; Shopify — якір, самі лише Facebook Ads — глухий кут.
  • Найбільший гальмівний фактор: більшість e-com реєстрацій узагалі не підʼєднують жодного джерела.

Тест 9. Чи може синтезувати весь датасет і створити ефективну рекомендацію

Запитання: якби ти був нашим продакт-маркетинг-менеджером, що саме ти б змінив на основі цих даних? (eng: If you were our Product Marketing Manager, what one thing would you change based on this data?)

Тут було цікаво, чи здатна модель синтезувати весь датасет в одну обґрунтовану стратегічну рекомендацію й подати її саме як рішення PMM, а не як спостереження  аналітика.

Що отримали:

GPT-5.5

  • Запропонував зробити e-commerce основним напрямом PMM-стратегії та перебудувати верхню частину воронки навколо e-commerce-сценаріїв.
  • Застеріг: дані про пробний період ненадійні (кількість paid перевищує trial), тому не варто на них надто покладатися.
  • Лаконічно й коректно, але без конкретного плану дій.

Gemini 3.1 Pro

  • Порадив змістити позиціонування, комунікацію та маркетинговий бюджет у бік e-commerce.
  • Аргумент: компанія залучає не ту аудиторію. Agencies та analysts мають низьку конверсію й високий відтік, а найцінніший сегмент отримує найменше уваги.
  • Конкретні кроки: змінити повідомлення на головній сторінці, перерозподілити рекламний бюджет, сфокусувати контент-маркетинг на e-commerce-сценаріях.

Grok 4.3

  • Пріоритет має бути на залучення та комунікацію для e-commerce; витрати на analysts і finance скоротити або жорсткіше кваліфікувати.
  • Найдетальніше пояснив стратегічну логіку: компанія платить за залучення користувачів, для яких продукт ще не створює достатньої цінності.
  • Зазначив, що це матиме більший вплив, ніж подальша оптимізація онбордингу.

Claude Opus 4.8

  • Переосмислив відповідь: змістив фокус із сегмента на wedge — основну точку входу на ринок.
  • Запропонував відмовитися від універсального «підключіть будь-які дані» й перебудувати верх воронки та перший досвід навколо власників бізнесу й маркетологів із корпоративною поштою, які стартують із готового шаблону дашборда.
  • Підкріпив цифрами: різниця конверсії корпоративних і публічних email, висока конверсія користувачів шаблонів, оцінка потенційного ефекту.

Яку LLM-модель вибирати для аналізу даних?  

Після десяти тестів відповідь виявилася не такою очевидною, як хотілося б. Усі моделі вміють аналізувати дані й можуть стати хорошими помічниками у роботі. Утім, роблять вони це дуже по-різному.

Одні швидше знаходять закономірності, інші краще пояснюють свої висновки, треті впевненіше переходять від аналізу до конкретних рекомендацій. Тому вибір моделі залежить не стільки від того, яка з них найкраща, скільки від того, який результат ви хочете отримати.

Також додаю короткий підсумок поведінки LLM-моделей.

Як підвищити шанси на кращу співпрацю з LLM-моделями?

Якщо коротко, ставтеся до моделі не як до чарівної кулі, а як до дуже швидкого колеги-джуніора. Вона може за хвилину знайти закономірність, яку ви шукали б годину. Але так само може впевнено піти не туди, якщо отримала нечітке завдання або сумнівні дані.

Ось кілька порад, які справді покращують результат:

  • Не зупиняйтеся на першій відповіді. Найцікавіші інсайти можете знайти, якщо почнете розкручувати модель запитаннями: «Чому?», «Що на це вплинуло?», «Що ще це може означати?».
  • Спочатку перевірте дані, а потім просіть їх аналізувати. Якщо датасет неповний або містить суперечності, модель не завжди зупиниться сама. Швидше за все, вона все одно спробує знайти відповідь.
  • Будьте конкретними у своїх запитах. «Що відбувається?» рідко призводить до корисних висновків. «Чому 68% користувачів не доходять до першого кроку онбордингу?» — уже зовсім інша розмова.
  • Не забувайте про контекст. Якщо у вас є власні визначення метрик, сегментів чи бізнес-термінів, дайте їх моделі. Інакше вона заповнить прогалини власними припущеннями.
  • Читайте не лише красиві графіки. Найцінніші застереження та пояснення часто заховані саме в текстовій відповіді.
  • І, головне, не делегуйте ШІ останнє слово. Модель чудово знаходить закономірності, але рішення, які впливають на бізнес, усе ще варто перевіряти на здоровий глузд і звіряти з першоджерелом.

Моделі навчилися відповідати, але сумніватися ще ні

Десять тестів показали дивну річ: моделі майже не сперечаються між собою про відповіді. Вони сперечаються хіба про подачу. Там, де дані чисті, чотири різні архітектури приходять до одного висновку. І це добра новина для всіх, хто боявся довіряти цифрам з чату.

Погана новина ховається в іншому. Жодна з чотирьох не спитала, чи коректно взагалі поставлене питання. Не запропонувала подивитися в CRM, де вже лежить готовий список ризикових клієнтів. Не порахувала, скільки коштуватиме розворот стратегії, який сама ж радить. Моделі грають блискуче, але тільки в межах дошки, яку їм намалювали.

Тому робочий розподіл на найближчий час виглядає так: модель шукає і рахує, людина ставить рамку і сумнівається. Перше вже коштує копійки й займає хвилини. Друге, як з’ясувалося, поки не продається ні за який токен. Можливо, нові моделі змінять цей баланс, але це вже тема для іншої статті.

Читайте также: OpenAI запустила ChatGPT Voice для десктопного застосунку — керувати комп’ютером і агентами тепер можна голосом

Від admin

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *