DeepSeek灰度测试AI语音对话:支持四种音色,实现双向实时语音交互
2026年9月13日,DeepSeek于9月12日在App端灰度测试AI语音对话功能。这是DeepSeek首次涉足语音交互领域,标志着这家以开源大模型闻名的公司正在从纯文本对话走向多模态交互。测试用户可以在App右上角看到喇叭入口,开启后即可实现双向语音实时交互——而非此前简单的语音转文字模式。
功能上线后,设置页面新增了"朗读音色"选项,内置四款不同风格的音色:贝壳(百变活泼)、白浪(明朗坚定)、海星(俏皮甜美)和暗潮(低沉浑厚)。四款音色覆盖了从活泼到沉稳、从甜美到低沉的不同风格,满足不同场景和用户偏好。这种多音色设计类似于OpenAI ChatGPT Voice的多模型选择——不过DeepSeek的音色选择更侧重"个性"而非"能力",体现了对用户体验细节的关注。
DeepSeek进入语音交互领域具有多重战略意义。第一,补齐多模态能力短板。此前DeepSeek的核心优势在于文本模型能力(V4.1 Flash性能超越V4 Pro且价格低77%)和开源生态(Mixtral系列),但在语音、图像和视频等多模态方面相对落后。语音对话功能的推出标志着DeepSeek正在补齐多模态短板,与OpenAI ChatGPT Voice和Google Gemini Live竞争。第二,降低使用门槛。语音交互比文本交互更自然,特别是对于不擅长打字的用户群体(如老年人和儿童),语音对话可大幅降低AI使用门槛,扩大用户群体。第三,为AI Agent铺路。语音是AI Agent与人类交互的重要通道——如果AI代理需要执行任务(如订餐、查询、控制设备),语音是最自然的指令输入方式。DeepSeek的语音功能可能为其Agent产品做准备。
然而,DeepSeek在语音领域面临激烈竞争。OpenAI ChatGPT Voice已支持GPT-5.6 Sol和GPT-6 Astra多模型选择和推理深度控制;Google Gemini Live具备实时视频交互能力;Apple也在整合Siri与ChatGPT。DeepSeek的优势在于性价比——如果其语音功能基于V4.1 Flash,调用成本可能远低于竞争对手。但语音交互的质量不仅取决于模型能力,还取决于语音合成(TTS)和语音识别(ASR)的技术水平——DeepSeek在这方面的积累尚需验证。四款音色的命名(贝壳、白浪、海星、暗潮)体现了DeepSeek的品牌调性——海洋主题与其"DeepSeek"(深海寻宝)的品牌意象一致,这种细节化的品牌建设值得关注。