Dieser Datensatz wurde für das Training eines ultrakompakten 33M-Parameter-Sprachmodells für mobile On-Device-Tastaturen (FUTO Keyboard) zusammengestellt.
Datenquellen & Herkunft
Der Korpus ist eine kuratierte Zusammenstellung aus folgenden Open-Source-Datensätzen:
German Wikipedia Dumps (CC BY-SA 4.0)
OpenAssistant Conversations (OASST) (Apache 2.0)
Leipzig Corpora Collection / News (CC BY)
Durchgeführte… See the full description on the dataset page: https://huggingface.co/datasets/VerbalJungle/German-KeyboardLM-Corpus.