В основі ChatGPT Voice — технологія GPT-Live, яку OpenAI вперше випустила на початку липня для мобільних застосунків. Вона дозволяє одночасно слухати й говорити, природно вставляючи короткі підтвердження на кшталт «зрозуміло», не перериваючи користувача, а важкі обчислення передає фоновим моделям для міркувань.

Читайте также: «Продавати години розробника, який завдяки ШІ став ефективнішим утричі, — це суцільний бізнес-мазохізм». Керівник InSoft.Partners про те, як штучний інтелект нищить класичний IT-аутсорс

Архітектура розділяє голосовий шар і виконавчі «двигуни»: поки триває розмова, окремі агенти в Codex чи ChatGPT Work можуть виконувати задачі асинхронно у фоні. Це дозволяє, наприклад, запустити кілька потоків роботи з однієї розмови й продовжувати говорити, поки агенти доводять завдання до кінця.

Voice-режим доступний у десктопному застосунку ChatGPT для тарифів Plus, Pro, Business, Edu та Enterprise; для двох останніх спершу діє двотижневий період раннього доступу, перш ніж функція стане ввімкненою за замовчуванням. Також голосовий режим можна використовувати в Codex з iOS-застосунку через парне підключення до комп’ютера у функції Remote — підтримка Android обіцяна найближчим часом.

За словами OpenAI, запуск — крок до ширшого бачення компанії: говорити про те, що потрібно зробити, і одразу отримувати рух одразу кількох задач у фоні «зі швидкістю думки». За інформацією Bloomberg, технологія GPT-Live також може лягти в основу майбутнього апаратного пристрою компанії — домашньої колонки-співрозмовника. Voice-режим у Codex видання Fortune й Yahoo прямо описують як хід, спрямований на розробників — одну з найприбутковіших категорій користувачів ШІ-інструментів.

Читайте также: Українські дрони вразили ще чотири oбʼєкти найбільшого російського маркетплейсу Wildberries: під ударом опинилися склади у Петербургзі Твері, Сімферополі і Новосаратовці

Що саме можна робити голосом

Функція працює одразу в трьох режимах десктопного застосунку — Chat, Work і Codex: можна почати нову задачу, перевірити прогрес наявних завдань чи скоригувати напрямок роботи, не перемикаючись назад на текстовий ввід. У демонстраційному відео OpenAI показала двох власних співробітників — інженера з розробницького досвіду Codex Джейсона Лю і техфахівця Codex Гіннес Чена, — які одночасно говорили в одну й ту саму сесію ChatGPT у десктопному застосунку, кожен даючи окремі інструкції.

На macOS ChatGPT Voice додатково підтримує функцію «Appshots» — вона дозволяє голосовому режиму аналізувати активне вікно на екрані користувача поряд з локальними файлами, структурою кодової бази й активними плагінами. Голосовий режим також працює з функцією Computer Use від OpenAI.

Читайте также: Український розробник створює шутер-компаньйон для робочого столу. Він може отримати варіант локалізації в дусі «згідно-відповідно»

Від admin

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *