LiveTalking:能实时对话的流式数字人直播引擎
LiveTalking 是 lipku 开源的实时流式数字人引擎:音视频同步、可打断、多并发,WebRTC 低延迟输出,Apache-2.0 可商用。
项目资料
GitHub Ecosystem- 许可证
- Apache-2.0
- 主语言
- Python
- 星标
- 9,662
- 核查时间
- 2026-10-01
以上快照资料以核查当日为准,可能随版本或运营策略变化。
无人直播、数字人客服这类场景,形象逼真只是及格线,真正的门槛是响应够快:观众一句话进来,数字人得当场接住。lipku 的 LiveTalking 是一个实时交互流式数字人引擎,音视频同步对话,README 自述“已在业内获得广泛商用”。它 2023 年 12 月起持续更新,最近一次提交在 2026 年 9 月 13 日——修了一个实打实的问题:断开的会话之前只是从字典里删掉引用,渲染、推理、TTS 线程仍在空转,每个泄漏会话白吃约 3 个 CPU 核心。视频号「左手AI」9 月底称它“真正能实现的数字人直播引擎”,指的就是这套实时链路。
核心功能
- 多模型可换:同一套框架支持 ernerf、musetalk、wav2lip、Ultralight-Digital-Human 四种数字人模型,按画质和算力挑。
- 实时可打断:数字人说话时用户能插话重说,走
flush_talk清空待播内容,不是播完才理你。 - 三种输出方式:WebRTC 低延迟实时交互、RTMP 推流进直播间、虚拟摄像头喂给 OBS。
- 动作编排:不说话的空闲时段播放自定义视频,直播画面不会僵住。
- 多并发与自定义形象:支持多路会话同时跑,形象可以换成自己的素材。
- LLM 与 TTS 可插:LLM 引擎支持 DashScope、OrcaRouter 等多家 OpenAI 兼容后端,TTS 侧支持声音克隆。
典型使用场景
- 24 小时无人直播:LLM 生成话术、数字人实时开口,配合动作编排撑住直播间。
- 企业知识库客服:用户语音提问,数字人实时回答,答错可打断重说。
- 在线教育与大屏讲解:课程录课用 API 批量生成,展厅大屏用
/human接口做互动讲解。
快速上手
git clone https://github.com/lipku/LiveTalking.git
conda create -n livetalking python=3.12
conda activate livetalking
pip install torch==2.9.1 torchvision==0.24.1 torchaudio==2.9.1 --index-url https://download.pytorch.org/whl/cu128
pip install -r requirements.txt
python app.py
README 注明已在 Ubuntu 22.04、Python 3.12、PyTorch 2.9.1、CUDA 12.8 测试通过;数字人模型权重需按文档单独下载。
小结
LiveTalking 适合要实时交互的直播和客服场景;只做离线成片、不需要低延迟的话,LongCat-Video-Avatar 1.5 这类离线模型出片质量更好。Apache-2.0 协议,Python 编写,截至 2026-10-01 约 9.7k 星。三点留意:环境偏重,CUDA 版本要对齐;口型质量取决于所选模型,wav2lip 快但糙、musetalk 细但吃算力;官方另有商业版,开源版遇到问题主要靠 issue。