本數據集是基於 Moemu/Muice-Dataset 進行製作的粵語 (Cantonese) 衍生版本。旨在模擬二次元角色的語言風格,包含日常生活、情感話題、自我認知增強等約 3,500 條對話。
日常導向:本訓練集主要圍繞日常話題展開,對專業性問題(如代碼、高級推理)做了簡化處理,模型可能會產生事實性錯誤。
性格特徵:為了模仿動漫角色的說話風格,訓練集可能含有傲嬌、偏見或不禮貌的回答。如需構建高度安全性的模型,請謹慎使用或進行篩選。
倫理風險:使用本數據集訓練模型所引起的任何法律或倫理風險,由訓練者自行承擔。
原作者: Moemu
粵語版本製作: AhYin
許可證:… See the full description on the dataset page:
https://huggingface.co/datasets/AhYin/Cantonese-Prototype-Roleplay-Dataset.