本資料集是一份臺灣日常情境的對話腳本(dialogue scripts)資料集,每筆樣本包含對話分類、主題、文字內容以及說話者輪廓/場景/天氣等情境 metadata。可作為文字→語音(TTS)合成、對話 ASR 評測之素材設計來源。共 29,337 筆樣本。
Dataset Details
Dataset Description
category:對話類別(如:餐廳、醫療、家庭、商業、交通等)。
theme:該段對話的細部主題。
text:對話腳本本文(可包含多輪、多角色)。
meta:情境 metadata,包含:
profile:說話者輪廓
loc:場景/地點
weather:當下天氣
可用於下游語音/對話應用:將腳本送入 TTS 管線生成多角色音訊、評測 dialogue-aware ASR、訓練具備情境感知的對話模型。… See the full description on the dataset page:
https://huggingface.co/datasets/lianghsun/tw-daily-dialogue-audio.