Домой Новости ИИ Опыт общения с Google Gemini Live на протяжении часа: почему это не...

Опыт общения с Google Gemini Live на протяжении часа: почему это не заменит человека

Автор протестировал Gemini Live в течение часовой прогулки и оценил новые возможности голосового чата на базе искусственного интеллекта.

1
0

Менее пяти лет назад общение с компьютером казалось сюжетом из научной фантастики. Теперь текстовые нейросети окружают нас повсюду, а многие пользователи спокойно обсуждают с ними работу, налоговые декларации, планы на отпуск или делятся эмоциями. Тем не менее, ощущение того, что такие беседы никогда не напоминают реальный диалог, оставалось всегда. В лучшем случае это воспринимается как общение с представителем техподдержки, к которому обращаются исключительно для решения конкретных проблем.

Демонстрация интерфейса Gemini Live на экране смартфона
Интерфейс режима Gemini Live

Компания OpenAI 8 июля 2026 года выпустила GPT-Live, глобально запустив её в ChatGPT взамен старого пошагового режима Advanced Voice Mode. Новая технология кардинально отличается от прежних голосовых функций. Раньше система преобразовывала речь в текст, пропускала его через большую языковую модель и озвучивала ответ с помощью синтезатора речи. Новые модели, включая появившуюся 15 сентября Google Gemini Live, работают с «сырым» аудиопотоком напрямую без промежуточных этапов транскрипции.

Как работает обработка аудио без промежуточного текста

Отказ от текстовой промежуточной стадии позволяет моделям отвечать за доли секунды, исключая привычные паузы. Система способна улавливать интонации, колебания голоса, раздражение или шутки, которые невозможно передать через текст. Кроме того, теперь можно перебивать нейросеть или позволять ей перебивать собеседника без зависаний системы, которая раньше определяла, чей сейчас ход.

Для проверки возможностей Gemini Live автор отправился на долгую прогулку вдоль речного берега, полностью посвятив её глубокому общению с искусственным интеллектом. Первые пятнадцать минут ушли на попытки запутать систему. Модель успешно поддерживала беседу на трёх языках, мгновенно адаптировалась к ускорению речи и автоматически переключалась на другой язык даже в середине одной фразы.

Проверка возможностей и языковых барьеров

Наиболее впечатляющим моментом стало задание произнести по буквам фразу «T-O-P-G-3-3-K». Модель сразу же ответила: «Вы по буквам произносите слово Top Geek, но используете цифру 3 вместо перевернутой буквы E». Это продемонстрировало либо абстрактное мышление, либо хорошее понимание интернет-концепции «леитспик».

После завершения экспериментов автор перешел к более личному разговору о работе, семье и планах на будущее. Несмотря на высокую скорость и отзывчивость, беседа ни разу не создала ощущение общения с живым человеком. Проблема заключалась вовсе не в том, что ответы звучали робототехнически или модель не понимала суть тем.

Ограничения эмоциональной связи с ИИ

Чат-боты созданы не для того, чтобы имитировать людей, а для выполнения роли официальных представителей, которые должны отвечать на вопросы, а не слушать собеседника. Когда люди звонят друзьям или родственникам, главная цель заключается не в обмене информацией, а в том, чтобы услышать голос близкого человека и поделиться собственным состоянием. У Gemini нет личной жизни, историй или причин искренне заботиться о пользователе.

Опыт общения с Google Gemini Live на протяжении часа: почему это не заменит человека — иллюстрация 2 к материалу
Прогулка с наушниками во время беседы с ИИ

Технические шероховатости устранены, но ощущение пустоты на другом конце линии осталось. Общение с искусственным интеллектом напоминает работу рации или разговор со смарт-эхом, которое способно ответить на любой вопрос, но не имеет ничего собственного, что можно было бы привнести в диалог.

Хотя ИИ-чаты стали привычным делом, автор отмечает, что общаться с ними никогда не казалось похожим на настоящий разговор. В основном к ним обращаются, когда возникает проблема, и ИИ помогает её преодолеть, как сотрудник техподдержки или оператор на телефоне.

Переход на обработку сырого аудио в GPT-Live и Gemini Live устраняет необходимость в постоянной цепочке «речь — текст — речь». Хотя это звучит как незначительная техническая деталь водопровода, именно она меняет всю картину, позволяя улавливать интонацию, колебания и эмоции.

Автор отмечает, что в ходе теста Gemini Live он сначала проверял границы возможностей системы, пытаясь зайти в тупик, но в итоге в тупике оказался сам. Модель без труда справилась со сменой темпа речи, переключением между тремя языками и даже распознаванием литспика (леитспика) при разборе фразы «T-O-P-G-3-3-K», где цифра 3 обозначает перевернутую букву E.

Опыт общения с Google Gemini Live на протяжении часа: почему это не заменит человека — иллюстрация 3 к материалу
Демонстрация работы мультиязычного голосового ввода

После тестов автор уделил около 45 минут или часу разговору о своей жизни, работе, семье и планах на будущее, гуляя вдоль речного берега. Тем не менее, даже при безупречной работе Google Gemini, беседа не смогла воспроизвести человеческое подключение и эмпатию.

По мнению автора, проблема кроется в самом назначении чат-ботов: они созданы не для имитации людей, а для роли официальных представителей, готовых дать справку. Настоящие звонки близким и друзьям нужны не ради сухой информации, а чтобы узнать о самочувствии друг друга и поделиться своим состоянием.

У ИИ нет личной жизни, личных историй или причин заботиться о пользователе. Устранение технических задержек и ограничений режима рации не решило главную проблему: на другом конце провода оказывается невероятно умное эхо, способное мгновенно ответить на любой вопрос, но абсолютно пустое внутри, так как ему нечего привнести в беседу от себя.

Опыт общения с Google Gemini Live на протяжении часа: почему это не заменит человека — иллюстрация 4 к материалу
Скриншот интерфейса Gemini Live

Особое внимание в материале уделяется специфике использования голосовых ИИ-помощников представителями разных поколений: отмечается, что значительная часть зумеров активно делится с языковыми моделями своими эмоциями и обращается к ним за жизненными советами.

Описывая свои ранние взаимодействия с GPT-Live, автор уточняет, что запускал эту систему несколько раз для решения вполне конкретных и бытовых запросов — в основном для поиска мест, где можно поесть, и интересных точек во время поездок в отпуск. При этом даже заметно возросшая скорость работы по сравнению со стандартным чатом не создала у него ощущения принципиальных изменений по сравнению с предыдущими версиями.

Размышляя о природе человеческого общения и телефонных звонках близким людям, автор подчеркивает ключевую деталь: звоня родителям, друзьям или возлюбленным, люди делают это не только для обмена информацией, но и для того, чтобы напрямую услышать голос собеседника, оценить его текущее состояние и дать ему знать о собственном.

В финальной оценке автор резюмирует, что технические шероховатости и неудобства остались в прошлом, и при наличии выбора он безоговорочно предпочел бы новый формат голосового ИИ старому. По его словам, разработчики незаметно избавились практически от всех раздражающих факторов, преследовавших пользователей при голосовом общении с искусственным интеллектом.