따라서 모델의 input/output은 다음과 같습니다.
CNN/Daily mail: CNN과 Daily Mail의 저널리스트가 작성한 300,000개가 넘는 고유한 뉴스 기사가 포함된 영어 dataset.
CNN/Daily mail dataset에는 2가지 데이터가 존재합니다.
tokenizer = AutoTokenizer.from_pretrained("google-t5/t5-small")
model = AutoModelForSeq2SeqLM.from_pretrained("google-t5/t5-small")
train_dataset = load_dataset("cnn_dailymail", "3.0.0", split='train[:1%]')
valid_dataset = load_dataset("cnn_dailymail", "3.0.0", split='validation[:1%]')
ROUGE score가 높지 않음.