观点 / 方法普通
语音与实时智能体最低延迟推理 API:以首 token 延迟(TTFT)为先的基准评测
原始标题:Lowest-Latency Inference APIs for Voice and Realtime Agents: A Time to First Token TTFT-First Benchmark
内容摘要
语音智能体的真实体验取决于首句延迟(TTFS)而非首 token 延迟(TTFT),后者仅标记生成开始,TTS 模型需等完整句子才能发声。评测覆盖 LLM、STT、TTS 及语音到语音全链路,并给出各层延迟预算:STT 约 100-200ms、LLM 300-500ms、TTS 100-200ms,端到端目标 700ms-1.2s。