Ten projekt zawiera zbiór danych (oraz skrypty do jego wygenerowania) przeznaczony do trenowania konwersacyjnych modeli językowych za pomocą procesu Supervised Fine-Tuning (SFT).
Główny plik z danymi to sftdataset.json.
Zbiór zawiera dokładnie 50,000 syntetycznych przykładów konwersacyjnych, przygotowanych specjalnie po to, aby wyuczyć surowy, nowo zainicjowany model zachowania się jak przydatny i uprzejmy asystent AI.
Rozkład… See the full description on the dataset page:
https://huggingface.co/datasets/onedevelopment/oneai-1.2-dataset.