ChatGPT получи нов гласов режим с GPT-Live, който прави разговорите с изкуствения интелект по-естествени и плавни. Моделът използва архитектура, която позволява на AI да слуша и говори едновременно, така че разговорът да не се превръща в поредица от отделни реплики.
При първоначалния гласов режим на ChatGPT през 2023 г. процесът е преминавал през три отделни системи. Речта първо се превръщала в текст, след което езиков модел генерирал отговор, а накрая система за преобразуване на текст в реч го прочитала на глас.
По-късният Advanced Voice Mode въвел единен мултимодален модел, който подобрил значително изживяването. Сега OpenAI използва GPT-Live, който разчита на т.нар. „full-duplex“ архитектура и може да слуша и говори едновременно.
Това решава един от досадните проблеми при предишния модел. Кратка пауза можеше да бъде възприета като край на репликата, което водеше до преждевременен отговор. GPT-Live може да реагира с кратки потвърждения като „мм-хм“ или „да“, докато потребителят продължава да говори.
Моделът може също да прехвърля по-сложни задачи към други AI системи във фонов режим. При въпроси, които изискват по-задълбочено разсъждение или проучване, GPT-Live може да използва по-мощни модели като GPT-5.5, без разговорът да бъде прекъсван.
GPT-Live е достъпен в приложенията на ChatGPT за Android и iOS, както и през уеб версията на услугата. Потребителите с планове Pro, Plus и Go получават достъп до GPT-Live-1, докато безплатният план предлага GPT-Live-1 mini.
Новият модел заменя предишния Advanced Voice като стандартен вариант за гласови разговори. Стартирането става чрез иконата за гласов режим, обозначена със символ на звукова вълна в дясната част на текстовото поле. При първо използване е необходимо да бъде разрешен достъп до микрофона.
След активирането на режима на екрана се появява плаваща интерактивна сфера, чрез която потребителят може да започне разговор. От настройките може да се избере и нивото на интелигентност на модела – Instant, Medium или High.
Тази възможност обаче не е налична при GPT-Live-1 mini и към момента изисква платен план. Гласовият режим продължава да работи и когато потребителят премине към друго приложение или заключи телефона си.
Една от функциите, които все още липсват, е споделянето на екран или видео. Потребителите могат обаче да се върнат към по-стария гласов модел от настройките на ChatGPT, в секцията Voice.
Там могат да бъдат променени и други параметри, включително гласът на асистента и езикът на разговорите. Възможно е също ChatGPT Voice да бъде избран като режим по подразбиране при стартиране на приложението.
Една от силните страни на GPT-Live е естественото протичане на по-дълги разговори. Потребителят не трябва да изчаква асистентът да приключи напълно, преди да започне да говори отново. Това прави взаимодействието по-близко до нормален разговор между двама души.
GPT-Live може да бъде полезен и при преводи в реално време. По време на разговора потребителят може да плъзне екрана надолу и да види транскрипция на казаното.
При въпроси, за които визуалната информация би била полезна, ChatGPT може да създаде интерактивен елемент наред с гласовия отговор. Така разговорът може да бъде допълнен с визуална информация, без потребителят да напуска гласовия режим.
По подразбиране GPT-Live работи на ниво Instant, което е предназначено за ежедневни въпроси и поставя акцент върху бързите отговори. При необходимост моделът може да извършва търсене или по-задълбочено разсъждение във фонов режим.
При по-сложни теми потребителите с достъп до Medium и High могат да изберат по-високо ниво на интелигентност. Това добавя малко време за обработка, но позволява на модела да отдели повече ресурси за сложни задачи.
GPT-Live представлява важна промяна в развитието на гласовите AI асистенти. Вместо потребителят да се адаптира към начина, по който машината обработва речта, технологията постепенно се доближава до естествения ритъм на човешкия разговор.
Повече информация за гласовия режим и останалите функции на ChatGPT е достъпна в официалния сайт на ChatGPT.
Все още няма коментари. Бъдете първи.