科学工具
科学工具让世界更美好
让世界更美好

音谷:AI多角色多情绪配音工具

音谷是开源的AI多角色多情绪配音平台,能为小说、剧本、视频等内容提供自动化、高度可定制的语音合成与配音服务,允许用户导入文本,进行多角色管理、情绪音色选择和绑定,能自动拆分台词并生成配音。音谷支持用户在编辑界面手动修改台词文本、角色归属、情绪类型及轻重程度,能自动保存更新,实现了精细化的配音控制。音谷采用了Electron+Vue作为前端、FastAPI/Python作为后端,兼容OpenAI API协议的大模型接口,基于Index-TTS-2.0提供多情绪TTS服务,支持Cloud Native Build平台加速。

多角色管理:建立角色库,为不同角色绑定专属音色

情绪控制:为台词设置多种情绪和强度,丰富表现力

智能处理:支持LLM自动拆分文本为台词

批量处理:批量生成配音,任务队列管理

灵活导出:导出配音与字幕文件

开放架构:支持自定义LLM和TTS服务接入

音谷技术栈

前端:Electron + Vue + Element Plus

后端:FastAPI / Python

AI接口:兼容OpenAI API协议的大模型

TTS服务:支持Index-TTS-2.0多情绪语音合成

音谷安装部署

1、克隆项目

git clone https://github.com/xcLee001/SonicVale.git
cd SonicVale

2、启动后端

1、下载ffmpeg.exe到app/core/ffmpeg/目录

2、安装依赖并启动服务:

pip install -r requirements.txt
uvicorn app.main:app --reload

3、启动前端

cd sonicvale-front
npm install
npm run start

音谷使用流程

1、创建项目并配置LLM和TTS服务

2、导入或粘贴文本内容

3、使用LLM自动拆分为台词

4、为每个角色绑定音色和情绪

5、批量生成配音

6、导出音频和字幕文件

角色与音色管理

• 创建多个角色,为每个角色绑定专属音色

• 支持参考音频上传,实现个性化语音克隆

• 多章节共享角色设置,保持一致性

台词编辑与情绪控制

• 手动修改台词文本、角色归属、情绪类型和强度

• 支持多种情绪:平静、高兴、生气、伤心、害怕等

• 修改后自动保存并更新

配音生成与编辑

• 支持单条或批量生成配音

• 生成后可调整速度、音量等参数

• 提供音频编辑工具,如区间选择、循环播放等

音谷配置选项

LLM配置

• 添加自定义LLM提供商

• 设置Base URL和API Key

• 配置可用模型列表

TTS配置

• 管理多个TTS引擎

• 设置音色参数

• 支持导入参考音频