REALTIME / LIP SYNC
实时数字人链路
HARD GATE不生成视频文件。DeepSeek V4 Flash 流式吐字,按自然句同步送入 豆包 TTS 2.0;麦克风候选语音先通过本人声纹验证,Agent 的扬声器回声不会再进入对话。SoulX 接入后消费同一份音频驱动口型。
MY VOICE / SPEAKER ID尚未录入本人声纹
只有已录入的本人音色能触发对话或打断;人格和 Agent 音色不会影响识别。
声纹档案只保存在当前浏览器;候选音频由你的服务器本地 Sherpa-ONNX 比对,不发送给大模型。VOICE STYLE黑猫侦探社咪仔 2.0 · 独立设置
DeepSeek 流式回复→豆包 TTS 2.0 流式声音→SoulX 待接入
- 对话模型
- DeepSeek V4 Flash · 非思考模式
- 语音服务
- Doubao - TTS 2.0 · 31种可切换音色
- 口型偏差
- 目标 ≤120 ms
- 数字人渲染
- 待接 SoulX
- 摄像头观察
- MediaPipe 端侧细节 · 不上传原始帧
- 说话人识别
- Sherpa-ONNX · 本人声纹门控
SWEET GIRLFRIEND;甜而不腻,可爱但不幼稚。