背景
需求方提交“古诗词集”临时语料入库需求,已提供古诗词朗诵录音合集 ZIP 及诗词原文文档。
当前录音素材为“一首古诗词对应一个完整音频文件”。为支持后续句级语料入库,需将每首完整朗诵音频按完整诗句切分,并输出句级音频和对应映射关系。
本次文本附件当前包含 20 首古诗词,具体以需求方最终提供的录音 ZIP 和文本版本为准。
负责人
AW
参考内容
需求文档
处理要求
音频切分规则
- 每首古诗词当前为一个完整音频文件,需按“完整诗句”切分为多个句级音频。
- 原则上以中文句号、问号、感叹号、分号等作为主要切分边界。
- 同一句中的逗号不作为切分边界,即上下半句需保留在同一个音频文件中。
- 需尽量完整保留句首、句尾发音及自然停顿,避免截断首字、尾字或造成明显听感不完整。
- 标题、作者、朝代、序号、朗诵者介绍等非诗词正文内容默认不纳入句级正文语料;如音频中存在,需在异常/备注中标注。
- 若朗诵存在漏读、重复、明显错读或与文本不一致,须记录,不得自行修改文本或掩盖异常。
切分示例
原文:
罗浮山下四时春,卢橘杨梅次第新。
日啖荔枝三百颗,不辞长作岭南人。
预期切分:
- 罗浮山下四时春,卢橘杨梅次第新。
- 日啖荔枝三百颗,不辞长作岭南人。
说明:“日啖荔枝三百颗,不辞长作岭南人。”为一个完整诗句,虽含逗号,但不可拆分为两个音频片段。
文件命名建议
{collection_name}_{poem_id}_{sentence_no}_{poem_title}_{reciter}.{extension}
示例:
古诗词集_GS-014_01_惠州一绝·食荔枝_刘蔚蓝.wav
古诗词集_GS-014_02_惠州一绝·食荔枝_刘蔚蓝.wav
若系统或文件环境不支持中文文件名,可采用:
gushici_GS-014_01.wav
gushici_GS-014_02.wav
但必须在映射清单中保留完整信息。
交付物
映射清单字段
| 字段 |
说明 |
| collection_name |
语料集名称,固定为“古诗词集” |
| poem_id |
诗词唯一 ID |
| poem_title |
诗词标题 |
| dynasty |
朝代 |
| author |
作者 |
| reciter |
朗诵者 |
| sentence_no |
句序号 |
| sentence_text |
句级原文 |
| original_audio_filename |
原始完整音频文件名 |
| audio_filename |
切分后的句级音频文件名 |
| start_time |
片段在原始音频中的起始时间 |
| end_time |
片段在原始音频中的结束时间 |
| duration |
当前句级音频时长 |
| cut_status |
切分状态 |
| qa_status |
质检状态 |
| text_audio_match_status |
音文一致性状态 |
| remarks |
异常或备注 |
验收标准
依赖与协作
- 文本基准以需求方提供的原始文档及 New 确认的标准化版本为准。
- 切分完成后,请将句级音频、映射清单和异常清单交接给 New。
- 若最终需上传 OSS,New 将整理待上传文件清单并协调 Fynn 处理。
背景
需求方提交“古诗词集”临时语料入库需求,已提供古诗词朗诵录音合集 ZIP 及诗词原文文档。
当前录音素材为“一首古诗词对应一个完整音频文件”。为支持后续句级语料入库,需将每首完整朗诵音频按完整诗句切分,并输出句级音频和对应映射关系。
本次文本附件当前包含 20 首古诗词,具体以需求方最终提供的录音 ZIP 和文本版本为准。
负责人
AW
参考内容
需求文档
处理要求
音频切分规则
切分示例
原文:
罗浮山下四时春,卢橘杨梅次第新。
日啖荔枝三百颗,不辞长作岭南人。
预期切分:
说明:“日啖荔枝三百颗,不辞长作岭南人。”为一个完整诗句,虽含逗号,但不可拆分为两个音频片段。
文件命名建议
示例:
若系统或文件环境不支持中文文件名,可采用:
但必须在映射清单中保留完整信息。
交付物
古诗词集_音频文本映射清单.xlsx或 CSV古诗词集_音频切分异常清单.xlsx或 CSV映射清单字段
验收标准
依赖与协作