This dataset is just a split of the original akemiH/NoteChat.
70% for train
15% for validation
15% for test
Below is the code snipped used to split the dataset.
from datasets import DatasetDict
from datasets import load_dataset
DATASET_SRC_NAME = "akemiH/NoteChat"
DATASET_DST_NAME = "DanielMontecino/NoteChat"
dataset = load_dataset(DATASET_SRC_NAME, split="train")
70% train, 30% test + validation
train_testvalid = dataset.train_test_split(test_size=0.3, seed=2024)