📄 siddhant7876/llama_tokenized_train_biodiv
This dataset contains LLaMA‑tokenized text data from the source dataset:
Source dataset: siddhant7876/textual_train_biodiv
Tokenizer: meta-llama/Llama-3.2-1B-Instruct
Context length: 2048
Total samples: 5000000