已结束已结束武汉城区方言语音采集及TTS音色克隆系统,预算3万可谈
武汉城区方言语音采集及TTS音色克隆系统‑详尽需求文档
文档版本:V1.1
变更记录:新增AI音频预质检模块;明确A/B业务:一套程序逻辑,存储物理隔离
项目背景:本项目用于武汉城区方言语料采集、数据集沉淀,同时面向普通用户提供自助音色克隆方言TTS能力。上层复用同一套应用代码,底层存储物理隔离,防止两类业务数据串扰。AI预质检为新增增值模块,需单独评估工作量。
重要边界:仅基于开源TTS模型部署适配,不做从零训练基础TTS模型;GPU、云服务器、对象存储、带宽、第三方云资源由甲方提供并承担费用,不在开发范围内。
1 总体架构要求
1. 整体为B/S浏览器网页系统,无需安装客户端。
2. 业务层:一套代码、一套业务逻辑、一套TTS推理服务,后台支持切换业务域访问。
3. 存储层【强约束】:
◦ 业务A(方言采集业务)、业务B(用户自助音色克隆业务)使用相互独立的数据库、独立音频存储目录/对象存储Bucket。
◦ 两套存储物理隔离,数据不可互相读写、不可互相流入;A业务导出数据集绝对不能带出B业务任何数据,B业务也读取不到A业务采集语料。
◦ 可使用同一个数据库实例下两个独立Database库,但禁止仅通过数据表字段、前缀做逻辑隔离作为唯一方案。
4. 新增模块:AI音频预质检(杂音检测),独立音频分析能力,仅做标记辅助人工,不自动做合格/不合格判定、不自动驳回录音。
两大业务定义
• 业务A:武汉城区方言采集业务。面向内部管理员、采集员、质检员,完成录音任务、采集方言原始语料、人工质检、数据集导出,产出模型训练用数据集。
• 业务B:用户自助音色克隆业务。面向外部普通终端用户,自助录制音色采样、输入文本生成武汉话语音、音频下载。
2 业务A:武汉城区方言采集业务功能需求
2.1 账号权限模块
1. 角色:系统管理员、采集员、质检员;全部账号由管理员后台创建,不开放自助注册。
2. 权限划分:
◦ 管理员:全部权限,可管理账号、任务、查看质检、导出数据集、切换业务域。
◦ 采集员:仅可查看分配给自己的录音任务、网页录音提交、重录退回的音频。
◦ 质检员:仅可对待质检音频进行审核操作。
3. 完整操作日志存入A业务独立库:账号变更、录音提交、质检操作、数据集导出全部留痕。
2.2 录音任务管理(管理员后台)
1. 支持新建、编辑、停用采集任务,填写任务名称、描述。
2. 脚本管理:批量导入、新增、编辑、删除武汉方言朗读文本句子。
3. 任务配置项:设置音频输出格式WAV、采样参数、分配给指定采集员、单用户分配句子数量。
4. 任务统计看板:展示待录、已提交、待质检、不合格数量。
2.3 网页录音前端(采集员)
1. 浏览器麦克风录音,录音波形可视化;支持单句重新录制覆盖旧录音。
2. 提交录音前弹出授权确认弹窗:录音人确认该音频可用于方言TTS研发。未确认不能提交。
3. 提交音频自动绑定:文本ID、录音人ID、任务编号,音频文件写入A业务专属存储。
4. 以网页麦克风录制为主,限制随意上传外部音频文件。
2.4 质检审核模块(含新增AI预质检)
1. 录音提交完成后,自动进入AI预质检流程:
◦ AI自动检测:环境杂音、爆音、静音过长、音量过高/过低;输出检测标签,标记在该条音频上。
◦ 规则:AI仅输出提示标签,不做合格/不合格结论,不能自动驳回录音,最终决定权交给人工质检员。
2. 人工质检页面:列表展示待质检条目,在线播放音频,对照方言文本查看AI预质检标签。
3. 人工操作:标记【合格】/【不合格】;不合格必须填写驳回原因(读错、普通话、杂音、音量异常等)。
4. 不合格录音自动退回对应采集员进行重录;支持批量质检操作。
5. 所有质检结果写入A独立数据库。
2.5 数据集导出
1. 筛选条件:任务、采集人员、质检状态、授权状态。
2. 仅导出A业务内已授权、质检合格的语料;输出压缩包,包含WAV音频文件+对应文本标注文件。
3. 强制限制:导出逻辑无法读取B业务任何数据表与音频资源。
3 业务B:用户自助音色克隆业务功能需求
复用系统原有TTS、音色克隆业务代码逻辑;所有数据落至B业务独立数据库、独立音频存储Bucket/目录。
1. 终端用户端:用户自助录制音色采样音频。
2. 支持输入武汉话文本,调用内部TTS服务生成方言语音;支持在线播放、音频下载。
3. 用户录音样本、生成语音、用户业务记录全部隔离在B存储,不会混入A业务数据集。
4. 管理员后台可以切换至B业务域查看业务B的数据,但底层存储和A完全隔离。
4 TTS、音色克隆与API接口需求
1. 选型开源TTS基础模型进行部署,完成武汉话方言效果验证与必要适配,不做基础模型从零训练。
2. 封装用户音色克隆能力、TTS推理接口,提供业务系统调用API,完成接口联调。
3. 共用同一套TTS推理服务,A/B业务请求数据分别落库至各自独立存储,杜绝串数据。
5 部署、交付与验收要求
1. 系统为B/S架构,浏览器访问;交付物包含系统部署、部署配置文档、完整操作使用手册。
2. 交付验收必测项:
1)验证A、B两套业务存储物理隔离;
2)A业务数据集导出,不可读取B业务任何数据;
3)B业务无法读取A业务采集语料;
4)AI预质检模块可正常识别杂音、爆音、音量异常,仅输出标签,不会自动驳回录音。
3. 项目预估周期3个月;因甲方硬件资源未到位、需求变更,工期相应顺延。
6 额外模块说明
AI音频预质检属于新增需求,需单独提供:模块工作量评估、开发周期、所使用开源组件及版权说明。
7 范围外说明
本需求不含以下工作,如需实施,双方另行评估工作量:
1. 从零训练TTS基础大模型;
2. 大规模专项模型优化;
3. 高并发推理集群建设;
4. 第三方商业服务接入;
文档版本:V1.1
变更记录:新增AI音频预质检模块;明确A/B业务:一套程序逻辑,存储物理隔离
项目背景:本项目用于武汉城区方言语料采集、数据集沉淀,同时面向普通用户提供自助音色克隆方言TTS能力。上层复用同一套应用代码,底层存储物理隔离,防止两类业务数据串扰。AI预质检为新增增值模块,需单独评估工作量。
重要边界:仅基于开源TTS模型部署适配,不做从零训练基础TTS模型;GPU、云服务器、对象存储、带宽、第三方云资源由甲方提供并承担费用,不在开发范围内。
1 总体架构要求
1. 整体为B/S浏览器网页系统,无需安装客户端。
2. 业务层:一套代码、一套业务逻辑、一套TTS推理服务,后台支持切换业务域访问。
3. 存储层【强约束】:
◦ 业务A(方言采集业务)、业务B(用户自助音色克隆业务)使用相互独立的数据库、独立音频存储目录/对象存储Bucket。
◦ 两套存储物理隔离,数据不可互相读写、不可互相流入;A业务导出数据集绝对不能带出B业务任何数据,B业务也读取不到A业务采集语料。
◦ 可使用同一个数据库实例下两个独立Database库,但禁止仅通过数据表字段、前缀做逻辑隔离作为唯一方案。
4. 新增模块:AI音频预质检(杂音检测),独立音频分析能力,仅做标记辅助人工,不自动做合格/不合格判定、不自动驳回录音。
两大业务定义
• 业务A:武汉城区方言采集业务。面向内部管理员、采集员、质检员,完成录音任务、采集方言原始语料、人工质检、数据集导出,产出模型训练用数据集。
• 业务B:用户自助音色克隆业务。面向外部普通终端用户,自助录制音色采样、输入文本生成武汉话语音、音频下载。
2 业务A:武汉城区方言采集业务功能需求
2.1 账号权限模块
1. 角色:系统管理员、采集员、质检员;全部账号由管理员后台创建,不开放自助注册。
2. 权限划分:
◦ 管理员:全部权限,可管理账号、任务、查看质检、导出数据集、切换业务域。
◦ 采集员:仅可查看分配给自己的录音任务、网页录音提交、重录退回的音频。
◦ 质检员:仅可对待质检音频进行审核操作。
3. 完整操作日志存入A业务独立库:账号变更、录音提交、质检操作、数据集导出全部留痕。
2.2 录音任务管理(管理员后台)
1. 支持新建、编辑、停用采集任务,填写任务名称、描述。
2. 脚本管理:批量导入、新增、编辑、删除武汉方言朗读文本句子。
3. 任务配置项:设置音频输出格式WAV、采样参数、分配给指定采集员、单用户分配句子数量。
4. 任务统计看板:展示待录、已提交、待质检、不合格数量。
2.3 网页录音前端(采集员)
1. 浏览器麦克风录音,录音波形可视化;支持单句重新录制覆盖旧录音。
2. 提交录音前弹出授权确认弹窗:录音人确认该音频可用于方言TTS研发。未确认不能提交。
3. 提交音频自动绑定:文本ID、录音人ID、任务编号,音频文件写入A业务专属存储。
4. 以网页麦克风录制为主,限制随意上传外部音频文件。
2.4 质检审核模块(含新增AI预质检)
1. 录音提交完成后,自动进入AI预质检流程:
◦ AI自动检测:环境杂音、爆音、静音过长、音量过高/过低;输出检测标签,标记在该条音频上。
◦ 规则:AI仅输出提示标签,不做合格/不合格结论,不能自动驳回录音,最终决定权交给人工质检员。
2. 人工质检页面:列表展示待质检条目,在线播放音频,对照方言文本查看AI预质检标签。
3. 人工操作:标记【合格】/【不合格】;不合格必须填写驳回原因(读错、普通话、杂音、音量异常等)。
4. 不合格录音自动退回对应采集员进行重录;支持批量质检操作。
5. 所有质检结果写入A独立数据库。
2.5 数据集导出
1. 筛选条件:任务、采集人员、质检状态、授权状态。
2. 仅导出A业务内已授权、质检合格的语料;输出压缩包,包含WAV音频文件+对应文本标注文件。
3. 强制限制:导出逻辑无法读取B业务任何数据表与音频资源。
3 业务B:用户自助音色克隆业务功能需求
复用系统原有TTS、音色克隆业务代码逻辑;所有数据落至B业务独立数据库、独立音频存储Bucket/目录。
1. 终端用户端:用户自助录制音色采样音频。
2. 支持输入武汉话文本,调用内部TTS服务生成方言语音;支持在线播放、音频下载。
3. 用户录音样本、生成语音、用户业务记录全部隔离在B存储,不会混入A业务数据集。
4. 管理员后台可以切换至B业务域查看业务B的数据,但底层存储和A完全隔离。
4 TTS、音色克隆与API接口需求
1. 选型开源TTS基础模型进行部署,完成武汉话方言效果验证与必要适配,不做基础模型从零训练。
2. 封装用户音色克隆能力、TTS推理接口,提供业务系统调用API,完成接口联调。
3. 共用同一套TTS推理服务,A/B业务请求数据分别落库至各自独立存储,杜绝串数据。
5 部署、交付与验收要求
1. 系统为B/S架构,浏览器访问;交付物包含系统部署、部署配置文档、完整操作使用手册。
2. 交付验收必测项:
1)验证A、B两套业务存储物理隔离;
2)A业务数据集导出,不可读取B业务任何数据;
3)B业务无法读取A业务采集语料;
4)AI预质检模块可正常识别杂音、爆音、音量异常,仅输出标签,不会自动驳回录音。
3. 项目预估周期3个月;因甲方硬件资源未到位、需求变更,工期相应顺延。
6 额外模块说明
AI音频预质检属于新增需求,需单独提供:模块工作量评估、开发周期、所使用开源组件及版权说明。
7 范围外说明
本需求不含以下工作,如需实施,双方另行评估工作量:
1. 从零训练TTS基础大模型;
2. 大规模专项模型优化;
3. 高并发推理集群建设;
4. 第三方商业服务接入;
*************
*************
评论
