LiveTalking:能实时对话的流式数字人直播引擎
LiveTalking 是 lipku 开源的实时流式数字人引擎:音视频同步、可打断、多并发,WebRTC 低延迟输出,Apache-2.0 可商用。
「声音克隆」标签聚合的各栏目已发布内容,按本站发布日期从新到旧排列。
6 条
LiveTalking 是 lipku 开源的实时流式数字人引擎:音视频同步、可打断、多并发,WebRTC 低延迟输出,Apache-2.0 可商用。
OpenBMB 的 VoxCPM2 用 2B 参数做开源语音克隆:30 种语言、48kHz 输出,Apache-2.0 可商用,配音和播客都能本地跑。
ElevenLabs 宣布 3 亿美元员工老股回购,估值 220 亿美元,较 2 月翻倍;Wellington 与 T. Rowe Price 领投。
ElevenLabs 9 月 28 日发布语音模型 v4 与 v4 Turbo:90+ 语言、10 秒克隆声音,Turbo 延迟约 100 毫秒,开放 API。
给视频、课程和有声内容做配音,常见的路是粘进云端 TTS:按字收费、声音同质化、文稿还得先上传。yovoice 把 7 个本地 TTS 模型经 audio.cpp 跑在自己机器上,1-60 秒参考音频克隆声音,录音、剪辑、导出齐备,另带 CLI 和 Agent Skill。Apache-2.0 开源,macOS 与 Windows 可用。
在本地把电子书转成有声书的开源工具,内置多种 TTS 引擎,支持语音克隆和 1158 种语言,可输出带章节与元数据的 m4b,无需云服务,最低 2GB 内存即可运行。