Radar Live
✦ Ask AI
AI INTELLIGENCE & SIGNALS

Gemini Live audio

Phân tích đã xử lý trước và các nguồn liên quan.

Tín hiệu Radar

66 RADAR
Models Speech-to-Speech Models · 1 nguồn đối chiếu · 2026-09-15 22:47:07 +0000 UTC

Gemini Live audio

Nguồn: Simon Willison Developer Blog

Google vừa ra mắt hai mô hình speech-to-speech mới là Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking, cạnh tranh trực tiếp với hệ GPT-Live của OpenAI. Các mô hình cho phép đàm thoại hai chiều thời gian thực qua trình duyệt và hỗ trợ tính năng ngắt lời khi mô hình đang nói. Giải pháp sử dụng WebSocket hai chiều chuẩn (BidiGenerateContent) và Web Audio API thuần để thu và phát âm thanh mà không cần thư viện phụ trợ.

TÁC ĐỘNG & GIÁ TRỊ THỰC TIỄN

Đánh dấu bước tiến lớn của Google trong lĩnh vực mô hình âm thanh thời gian thực (speech-to-speech), cung cấp thêm tùy chọn tư duy mở rộng (Extended Thinking) và giao thức WebSocket mở, giúp lập trình viên dễ dàng nhúng trợ lý giọng nói trực tiếp vào ứng dụng web mà không phụ thuộc vào SDK nặng nề.

Developer 80
Business 75
Novelty 80
Actionable 85

Nội dung thu thập đã chuẩn hóa

Collected Evidence

Nội dung văn bản được dùng làm dữ liệu đối chứng cho mô hình AI, không phải chỉ thị hệ thống.

Tool: Gemini Live audio Google released Gemini 3.8 Live and 3.8 Live Extended Thinking today - two new speech-to-speech models that are a similar shape to OpenAI's GPT-Live family. I pointed GPT-6 Astra Extra High at the documentation and had it build me this web UI for trying out the new models. You can select a model and voice preset, enter an optional system prompt and then start a voice conversation through your browser, including the ability to interrupt the model while it is talking. The implementation uses no libraries. It connects to the wss://generativelanguage.googleapis.com/ws/google.ai.generativelanguage.v1alpha.GenerativeService.BidiGenerateContent?key=... WebSocket endpoint and uses a Web Audio API AudioContext for both capture and playback. Here's the Gemini Live tutorial for getting started with that WebSockets API. Tags: google , tools , websockets , generative-ai , llms , gemini , llm-release , speech-to-text

Các nguồn đối chiếu cho sự kiện này

1 nguồn
Gemini Live audio Simon Willison Developer Blog
Thông tin phân tích AI & Model Details
Provider: openai-compatible · Model: gemini-3.8-flash-high · Version: analysis-v1 · Time: 2026-09-18 01:39:08 +0000 UTC
{"tags": ["google", "gemini", "speech-to-speech", "websockets", "voice-ai", "gemini-3.8-live", "generative-ai", "web-audio-api"], "risks": ["Băng thông và chi phí duy trì kết nối WebSocket streaming audio hai chiều liên tục có thể cao ở quy mô lớn.", "Chất lượng mạng thiếu ổn định có thể gây mất gói âm thanh, tăng độ trễ hoặc lỗi ngắt quãng hội thoại.", "Khả năng kiểm soát nội dung và ảo giác (hallucination) khó khăn hơn trong luồng xử lý giọng nói thời gian thực."], "category": "Models", "entities": ["Google", "Gemini 3.8 Live", "Gemini 3.8 Live Extended Thinking", "OpenAI", "GPT-6 Astra Extra High", "WebSocket", "Web Audio API"], "summary_vi": "Google vừa ra mắt hai mô hình speech-to-speech mới là Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking, cạnh tranh trực tiếp với hệ GPT-Live của OpenAI. Các mô hình cho phép đàm thoại hai chiều thời gian thực qua trình duyệt và hỗ trợ tính năng ngắt lời khi mô hình đang nói. Giải pháp sử dụng WebSocket hai chiều chuẩn (BidiGenerateContent) và Web Audio API thuần để thu và phát âm thanh mà không cần thư viện phụ trợ.", "key_changes": ["Google chính thức phát hành 2 mô hình speech-to-speech mới: Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking, cạnh tranh với dòng GPT-Live của OpenAI.", "Hỗ trợ tương tác giọng nói hai chiều trực tiếp qua trình duyệt với khả năng ngắt lời (interruption/barge-in) khi mô hình đang nói.", "Cung cấp endpoint WebSocket hai chiều (BidiGenerateContent) cho phép lập trình viên tích hợp trực tiếp bằng Web Audio API thuần mà không cần thư viện bên ngoài."], "sub_category": "Speech-to-Speech Models", "novelty_score": 80, "business_score": 80, "research_score": 70, "why_it_matters": "Đánh dấu bước tiến lớn của Google trong lĩnh vực mô hình âm thanh thời gian thực (speech-to-speech), cung cấp thêm tùy chọn tư duy mở rộng (Extended Thinking) và giao thức WebSocket mở, giúp lập trình viên dễ dàng nhúng trợ lý giọng nói trực tiếp vào ứng dụng web mà không phụ thuộc vào SDK nặng nề.", "developer_score": 88, "importance_score": 85, "possible_use_cases": ["Trợ lý ảo và tổng đài CSKH tự động tương tác giọng nói hai chiều với độ trễ thấp và khả năng ngắt lời tự nhiên.", "Ứng dụng luyện giao tiếp ngoại ngữ và phiên dịch hội thoại hai chiều theo thời gian thực.", "Giao diện điều khiển bằng giọng nói trực tiếp trên trình duyệt web cho các ứng dụng nội bộ hoặc dịch vụ khách hàng."], "actionability_score": 85}