文章目录
-
- 本期目标
- 架构
-
- 关键技术选型
- 📌 前置准备:环境配置(必做!)
-
- 1. 安装必要软件
- 2. 获取DashScope API Key(关键!)
- 🛠️ 项目搭建步骤
-
- 步骤 1:环境准备与依赖配置
- 步骤 2:设计事件体系(核心基础)
- 步骤 3:实现 STT 组件(语音→文本)
- 步骤 4:实现 TTS 组件(文本→语音)
- 步骤 5:构建 ReactAgent(智能体大脑)
- 步骤 6:实现工具(Function Calling)
- 步骤 7:编排管道(Pipeline)
- 步骤 8:WebSocket 实时通信
- 步骤 9:前端实现(录音与播放)
- 步骤 10:打断机制实现
- 🚀 运行应用
- 🔍 常见问题及解决方案(新手必看)
-
- 问题1:浏览器无法访问麦克风
- 问题2:WebSocket连接失败
- 问题3:API Key无效
- 问题4:AI不回复
- 其他问题
- 💡 项目结构总结
- 📚 为什么这个设计好?
- ✅ 最终验证
- 💬 给新手的额外建议
本期目标
基于Spring AI Alibaba构建实时语音对话 Agent智能体,利用 WebSocket 实现全双工语音交互,能够与 AI 进行自然的语音对话,具体包括以下功能:
- 实时语音对话: WebSocket 实现低延迟音频流传输
- 打断功能: AI 播放时可随时点击打断
- 流式处理: STT → Agent → TTS 全流程流式响应
- 工具调用: 集成 Function Calling,示例为航班预订助手
架构
这是一个典型的 STT → Agent → TTS 语音管道架构,核心特点是全流式处理:
┌─────────┐ PCM Audio ┌───────────────────┐
│ │ ───────────────► │ │
│ Browser │ │ VoiceWebSocket │
│ │ ◄─────────────── │ Handler │
└─────────┘ PCM + Events └─────────┬─────────┘





