🤖 Google Gemini 3.8: теперь ИИ тупит в два раза быстрее (и дешевле!)
Помните эти неловкие паузы, когда голосовой ИИ зависает, переваривая фразу? Google это исправил. Модели Gemini 3.8 Live и 3.8 Live Extended Thinking созданы специально для продвинутых аудио-агентов. Теперь это не «франкенштейн» из трех разных программ, а единая мультимодальная сеть, которая обрабатывает аудио напрямую.
⚡️ Главные фишки:
• Мышление на лету: Версия Extended Thinking строит логические цепочки в уме прямо во время разговора, не прерывая диалог.
• Голос + Зрение: ИИ может параллельно анализировать видеострим с камеры и голосом комментировать то, что видит.
• Фоновые действия: Агент асинхронно вызывает API, проверяет базы или отправляет почту прямо посреди предложения.
• Полиглот: Поддержка 97 языков с переключением на лету и идеальное распознавание сложных промокодов и артикулов.
🛠 Технические детали для разработчиков:
• Live API: Двунаправленный стриминг через WebSockets или gRPC для минимальной latency.
• Аудио: Поддержка сырого потока PCM (16-bit, 16kHz/24kHz) на вход и выход.
• Контроль логики: Параметр thinking_budget гибко настраивает лимиты на «внутреннее рассуждение» модели.
• Function Calling: Асинхронный вызов функций — модель выдает tool_call в фоне, не прерывая генерацию аудио.
• Экосистема: Готовая интеграция с LiveKit, LangChain, Agora и Vercel AI SDK.
💰 OpenAI, подвинься: цены ниже в 2 раза
Google включил жесткий демпинг в Google AI Studio и Gemini API:
• Входящее аудио — $0.005 / мин
• Исходящее аудио — $0.018 / мин
🔗 Полезные ссылки для старта:
• Документация Google AI Studio Live API — официальный гайд по подключению и настройке WebSocket-соединения.
• Интеграция с LiveKit Agents — готовый фреймворк для сборки голосовых ботов на базе новых моделей Gemini.
Эпоха меню «нажмите один» – ВСЁ! Будущее за ИИ, который соображает в реальном времени! 🚀
Помните эти неловкие паузы, когда голосовой ИИ зависает, переваривая фразу? Google это исправил. Модели Gemini 3.8 Live и 3.8 Live Extended Thinking созданы специально для продвинутых аудио-агентов. Теперь это не «франкенштейн» из трех разных программ, а единая мультимодальная сеть, которая обрабатывает аудио напрямую.
⚡️ Главные фишки:
• Мышление на лету: Версия Extended Thinking строит логические цепочки в уме прямо во время разговора, не прерывая диалог.
• Голос + Зрение: ИИ может параллельно анализировать видеострим с камеры и голосом комментировать то, что видит.
• Фоновые действия: Агент асинхронно вызывает API, проверяет базы или отправляет почту прямо посреди предложения.
• Полиглот: Поддержка 97 языков с переключением на лету и идеальное распознавание сложных промокодов и артикулов.
🛠 Технические детали для разработчиков:
• Live API: Двунаправленный стриминг через WebSockets или gRPC для минимальной latency.
• Аудио: Поддержка сырого потока PCM (16-bit, 16kHz/24kHz) на вход и выход.
• Контроль логики: Параметр thinking_budget гибко настраивает лимиты на «внутреннее рассуждение» модели.
• Function Calling: Асинхронный вызов функций — модель выдает tool_call в фоне, не прерывая генерацию аудио.
• Экосистема: Готовая интеграция с LiveKit, LangChain, Agora и Vercel AI SDK.
💰 OpenAI, подвинься: цены ниже в 2 раза
Google включил жесткий демпинг в Google AI Studio и Gemini API:
• Входящее аудио — $0.005 / мин
• Исходящее аудио — $0.018 / мин
🔗 Полезные ссылки для старта:
• Документация Google AI Studio Live API — официальный гайд по подключению и настройке WebSocket-соединения.
• Интеграция с LiveKit Agents — готовый фреймворк для сборки голосовых ботов на базе новых моделей Gemini.
Эпоха меню «нажмите один» – ВСЁ! Будущее за ИИ, который соображает в реальном времени! 🚀