Skip to content

[临时语料入库][音频文本处理] 古诗词集录音按诗句切分及映射清单交付 #468

Description

@midanc

背景

需求方提交“古诗词集”临时语料入库需求,已提供古诗词朗诵录音合集 ZIP 及诗词原文文档。

当前录音素材为“一首古诗词对应一个完整音频文件”。为支持后续句级语料入库,需将每首完整朗诵音频按完整诗句切分,并输出句级音频和对应映射关系。

本次文本附件当前包含 20 首古诗词,具体以需求方最终提供的录音 ZIP 和文本版本为准。

负责人

AW

参考内容

需求文档

处理要求

音频切分规则

  • 每首古诗词当前为一个完整音频文件,需按“完整诗句”切分为多个句级音频。
  • 原则上以中文句号、问号、感叹号、分号等作为主要切分边界。
  • 同一句中的逗号不作为切分边界,即上下半句需保留在同一个音频文件中。
  • 需尽量完整保留句首、句尾发音及自然停顿,避免截断首字、尾字或造成明显听感不完整。
  • 标题、作者、朝代、序号、朗诵者介绍等非诗词正文内容默认不纳入句级正文语料;如音频中存在,需在异常/备注中标注。
  • 若朗诵存在漏读、重复、明显错读或与文本不一致,须记录,不得自行修改文本或掩盖异常。

切分示例

原文:

罗浮山下四时春,卢橘杨梅次第新。
日啖荔枝三百颗,不辞长作岭南人。

预期切分:

  1. 罗浮山下四时春,卢橘杨梅次第新。
  2. 日啖荔枝三百颗,不辞长作岭南人。

说明:“日啖荔枝三百颗,不辞长作岭南人。”为一个完整诗句,虽含逗号,但不可拆分为两个音频片段。

文件命名建议

{collection_name}_{poem_id}_{sentence_no}_{poem_title}_{reciter}.{extension}

示例:

古诗词集_GS-014_01_惠州一绝·食荔枝_刘蔚蓝.wav
古诗词集_GS-014_02_惠州一绝·食荔枝_刘蔚蓝.wav

若系统或文件环境不支持中文文件名,可采用:

gushici_GS-014_01.wav
gushici_GS-014_02.wav

但必须在映射清单中保留完整信息。

交付物

  • 全量句级切分音频文件
  • 古诗词集_音频文本映射清单.xlsx 或 CSV
  • 古诗词集_音频切分异常清单.xlsx 或 CSV
  • 原始音频与句级音频对应关系
  • 如可提供,原始音频总时长与句级片段总时长的核对结果

映射清单字段

字段 说明
collection_name 语料集名称,固定为“古诗词集”
poem_id 诗词唯一 ID
poem_title 诗词标题
dynasty 朝代
author 作者
reciter 朗诵者
sentence_no 句序号
sentence_text 句级原文
original_audio_filename 原始完整音频文件名
audio_filename 切分后的句级音频文件名
start_time 片段在原始音频中的起始时间
end_time 片段在原始音频中的结束时间
duration 当前句级音频时长
cut_status 切分状态
qa_status 质检状态
text_audio_match_status 音文一致性状态
remarks 异常或备注

验收标准

  • 所有待处理诗词均完成句级音频切分,或在异常清单中说明未完成原因
  • 每段句级音频均对应一条完整诗句,不跨句、不漏句、不重复切分
  • 每段音频均可通过 poem_id、sentence_no、文件名在映射清单中定位
  • 音频与对应文本不一致的问题已明确标记
  • 音频文件可正常播放,无明显文件损坏或首尾截断
  • 已将句级音频、映射清单及异常清单交接给 New

依赖与协作

  • 文本基准以需求方提供的原始文档及 New 确认的标准化版本为准。
  • 切分完成后,请将句级音频、映射清单和异常清单交接给 New。
  • 若最终需上传 OSS,New 将整理待上传文件清单并协调 Fynn 处理。

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

Type

Projects

Relationships

None yet

Development

No branches or pull requests

Issue actions