服务内容
核心服务能力
- 语音识别(ASR):实时流式与离线批量识别,支持中英文及粤语、四川话等主要方言,延迟 < 300ms,普通话识别率 95%+(带热词优化 98%+),含标点恢复、说话人分离。
- 语音合成(TTS):高质量自然语音合成(MOS 4.0+),支持多音色、多情感、声音克隆(3-10 秒音频克隆专属音色)、SSML 精细控制,首包延迟 < 200ms。
- 声纹识别:说话人识别(1:N)、说话人验证(1:1)、声纹注册与活体检测,防止录音/回放攻击,适用于电话银行身份验证、安防声纹比对等场景。
- 语音增强:环境降噪、回声消除(AEC)、音量归一化、受损音频修复、多人混合语音分离。
- 语音分析:情感分析、关键词检测(KWS)、语种识别、语速分析、音质评估。
交付物清单
| 阶段 | 交付物 |
|---|---|
| 选型 | 《模型选型报告》 |
| 模型 | 优化后的语音 AI 模型 |
| 服务 | 语音 API 服务(ASR/TTS/声纹) |
| 集成 | 集成 SDK + API 文档 |
| 测试 | 《效果测试报告》《性能测试报告》 |
| 运维 | 《部署方案》《运维手册》 |



