组合式语音(composed:ASR → LLM → TTS 三段式)向 Realtime Agent 的工具合约对齐,并优化连续对话响应时延。 目标:`用户说完 → TTS 音频播放` 时延优化到 ~1.7s(1.1~2.1s)。 ## 分阶段 PR(按顺序合入) - [x] 工具层与对话 Agent 合约对齐 - 日程工具:ScheduleResultObserver、懒加载地点搜索(失败重试)、取消安全执行 - 对话控制:新增 end_conversation、收紧 request_user_input schema - 对话 Agent:流式输出、observer 接线、AgentTurnTiming 埋点 - [x] 组合式语音编排器核心 - 新增 composed/agent.py(编排)、delivery、session - [x] 组合式语音装配 + TTS 预连接时延优化 - composition 工厂、gateway 接线、ASR/TTS 适配器 - speech/pipeline.py TTS 热连接(prewarm)
组合式语音(composed:ASR → LLM → TTS 三段式)向 Realtime Agent 的工具合约对齐,并优化连续对话响应时延。
目标:
用户说完 → TTS 音频播放时延优化到1.7s(1.12.1s)。分阶段 PR(按顺序合入)