上述数据集为ABSA(Aspect-Based Sentiment Analysis)领域数据集,基本形式为从句子中抽取:方面术语、方面类别(术语类别)、术语在上下文中情感极性以及针对该术语的观点词,不同数据集抽取不同的信息,这点在jsonl文件的“instruction”键中有分别提到,在此我将其改造为了生成任务,需要模型按照一定格式生成抽取结果。
补充:SemEval-2015数据集文件夹中有两个文件夹"laptop"和"restaurant",其实根据数据集文本的主要围绕主题区分的。抽取的元素方面,laptop和restaurant两文件夹中,数据的抽取元素也不同,laptop抽取的是方面类别和情感极性的二元组,restaurant抽取的是方面术语、方面类别和情感极性的三元组
{
"task_type": "generation",
"dataset": "acos",
"input": ["the computer has difficulty switching… See the full description on the dataset page:
https://huggingface.co/datasets/NEUDM/semeval-2015.