已结束已结束武汉城区方言语音采集及TTS音色克隆系统,预算3万可谈

武汉城区方言语音采集及TTS音色克隆系统‑详尽需求文档



文档版本:V1.1

变更记录:新增AI音频预质检模块;明确A/B业务:一套程序逻辑,存储物理隔离

项目背景:本项目用于武汉城区方言语料采集、数据集沉淀,同时面向普通用户提供自助音色克隆方言TTS能力。上层复用同一套应用代码,底层存储物理隔离,防止两类业务数据串扰。AI预质检为新增增值模块,需单独评估工作量。

重要边界:仅基于开源TTS模型部署适配,不做从零训练基础TTS模型;GPU、云服务器、对象存储、带宽、第三方云资源由甲方提供并承担费用,不在开发范围内。

1 总体架构要求



1. 整体为B/S浏览器网页系统,无需安装客户端。



2. 业务层:一套代码、一套业务逻辑、一套TTS推理服务,后台支持切换业务域访问。



3. 存储层【强约束】:



◦ 业务A(方言采集业务)、业务B(用户自助音色克隆业务)使用相互独立的数据库、独立音频存储目录/对象存储Bucket。



◦ 两套存储物理隔离,数据不可互相读写、不可互相流入;A业务导出数据集绝对不能带出B业务任何数据,B业务也读取不到A业务采集语料。



◦ 可使用同一个数据库实例下两个独立Database库,但禁止仅通过数据表字段、前缀做逻辑隔离作为唯一方案。



4. 新增模块:AI音频预质检(杂音检测),独立音频分析能力,仅做标记辅助人工,不自动做合格/不合格判定、不自动驳回录音。

两大业务定义

• 业务A:武汉城区方言采集业务。面向内部管理员、采集员、质检员,完成录音任务、采集方言原始语料、人工质检、数据集导出,产出模型训练用数据集。



• 业务B:用户自助音色克隆业务。面向外部普通终端用户,自助录制音色采样、输入文本生成武汉话语音、音频下载。



2 业务A:武汉城区方言采集业务功能需求



2.1 账号权限模块



1. 角色:系统管理员、采集员、质检员;全部账号由管理员后台创建,不开放自助注册。



2. 权限划分:



◦ 管理员:全部权限,可管理账号、任务、查看质检、导出数据集、切换业务域。



◦ 采集员:仅可查看分配给自己的录音任务、网页录音提交、重录退回的音频。



◦ 质检员:仅可对待质检音频进行审核操作。



3. 完整操作日志存入A业务独立库:账号变更、录音提交、质检操作、数据集导出全部留痕。



2.2 录音任务管理(管理员后台)



1. 支持新建、编辑、停用采集任务,填写任务名称、描述。



2. 脚本管理:批量导入、新增、编辑、删除武汉方言朗读文本句子。



3. 任务配置项:设置音频输出格式WAV、采样参数、分配给指定采集员、单用户分配句子数量。



4. 任务统计看板:展示待录、已提交、待质检、不合格数量。



2.3 网页录音前端(采集员)



1. 浏览器麦克风录音,录音波形可视化;支持单句重新录制覆盖旧录音。



2. 提交录音前弹出授权确认弹窗:录音人确认该音频可用于方言TTS研发。未确认不能提交。



3. 提交音频自动绑定:文本ID、录音人ID、任务编号,音频文件写入A业务专属存储。



4. 以网页麦克风录制为主,限制随意上传外部音频文件。



2.4 质检审核模块(含新增AI预质检)



1. 录音提交完成后,自动进入AI预质检流程:



◦ AI自动检测:环境杂音、爆音、静音过长、音量过高/过低;输出检测标签,标记在该条音频上。



◦ 规则:AI仅输出提示标签,不做合格/不合格结论,不能自动驳回录音,最终决定权交给人工质检员。



2. 人工质检页面:列表展示待质检条目,在线播放音频,对照方言文本查看AI预质检标签。



3. 人工操作:标记【合格】/【不合格】;不合格必须填写驳回原因(读错、普通话、杂音、音量异常等)。



4. 不合格录音自动退回对应采集员进行重录;支持批量质检操作。



5. 所有质检结果写入A独立数据库。



2.5 数据集导出



1. 筛选条件:任务、采集人员、质检状态、授权状态。



2. 仅导出A业务内已授权、质检合格的语料;输出压缩包,包含WAV音频文件+对应文本标注文件。



3. 强制限制:导出逻辑无法读取B业务任何数据表与音频资源。



3 业务B:用户自助音色克隆业务功能需求

复用系统原有TTS、音色克隆业务代码逻辑;所有数据落至B业务独立数据库、独立音频存储Bucket/目录。

1. 终端用户端:用户自助录制音色采样音频。



2. 支持输入武汉话文本,调用内部TTS服务生成方言语音;支持在线播放、音频下载。



3. 用户录音样本、生成语音、用户业务记录全部隔离在B存储,不会混入A业务数据集。



4. 管理员后台可以切换至B业务域查看业务B的数据,但底层存储和A完全隔离。



4 TTS、音色克隆与API接口需求



1. 选型开源TTS基础模型进行部署,完成武汉话方言效果验证与必要适配,不做基础模型从零训练。



2. 封装用户音色克隆能力、TTS推理接口,提供业务系统调用API,完成接口联调。



3. 共用同一套TTS推理服务,A/B业务请求数据分别落库至各自独立存储,杜绝串数据。



5 部署、交付与验收要求



1. 系统为B/S架构,浏览器访问;交付物包含系统部署、部署配置文档、完整操作使用手册。



2. 交付验收必测项:

1)验证A、B两套业务存储物理隔离;

2)A业务数据集导出,不可读取B业务任何数据;

3)B业务无法读取A业务采集语料;

4)AI预质检模块可正常识别杂音、爆音、音量异常,仅输出标签,不会自动驳回录音。



3. 项目预估周期3个月;因甲方硬件资源未到位、需求变更,工期相应顺延。



6 额外模块说明



AI音频预质检属于新增需求,需单独提供:模块工作量评估、开发周期、所使用开源组件及版权说明。



7 范围外说明



本需求不含以下工作,如需实施,双方另行评估工作量:



1. 从零训练TTS基础大模型;



2. 大规模专项模型优化;



3. 高并发推理集群建设;



4. 第三方商业服务接入;
已有10人报名
*************
*************
浏览 976
点赞
13评论
收藏
1分享

手机扫一扫分享

分享
举报
评论
图片
表情
全部评论
伐竹猫5天前
网站APP音频应用开发,全栈开发
点赞回复
kemancool5天前
网页采集、三个角色、录音质检和数据导出可以做,A/B 两套数据库和存储按文档隔开,导出不会串数据。开源 TTS 部署在客户的 GPU 上,封装接口给网页调用,能出音频、能下载。不从零训练模型。预质检按文档单独估
点赞回复
来生缘5天前
擅长 Python/FastAPI + Vue3 语音类 Web 系统开发,熟悉开源 TTS(CosyVoice/GPT-SoVITS)部署与音色克隆 API 封装,熟悉数据库/存储物理隔离架构,提供完整部署文档与远程联调交付。
点赞回复
全栈开发、ai智能领域开发设计
点赞回复
现成生产案例可供验证,微信小程序搜车汇荟,声音采集、声音克隆、ai视屏合成等
点赞回复
何文坚5天前
有TTS音色克隆开发经验,可提供demo
点赞回复
lker5天前
武汉公司,有TTS经验
点赞回复
思君5天前
刚做完一个tts 多模态微调,有相关经验
点赞回复
武汉本地公司,有语音及大模型相关开发经验,产品已上线,期待合作
点赞回复
武汉市区,有丰富经验
点赞回复
加载更多
推荐
点赞
13评论
收藏
1分享

手机扫一扫分享

分享
举报