Views
No views yet
TinyLlama/TinyLlama-1.1B-Chat-v1.0 on HuggingFaceH4/ultrachat_200k, trained with tinyllama-training.ipynb and saved under tinyllama-ultrachat-rslora/.TinyLlama/TinyLlama-1.1B-Chat-v1.0HuggingFaceH4/ultrachat_200kquick_test = False512Rank-Stabilized LoRA1282560.04q_proj, k_proj, v_proj, o_proj, gate_proj, up_proj, down_projbf16256410241e-41.04096./tinyllama-ultrachat-rslora| Item | Value |
|---|---|
| Processed training rows | 657,771 |
| Processed evaluation rows | 73,150 |
| Optimizer steps | 643 |
| Epochs | 1.0 |
| Effective batch size | 1024 |
| Train runtime | 6:32:07 |
| Eval runtime | 0:00:38.21 |
| Train samples / second | 27.958 |
| Train steps / second | 0.027 |
| Eval samples / second | 107.196 |
| Eval steps / second | 0.419 |
| Final train loss | 1.0671 |
| Final eval loss | 1.0621 |
| Final perplexity | 2.8925 |
| Adapter output | ./tinyllama-ultrachat-rslora/adapter |
| Merged output | ./tinyllama-ultrachat-rslora/merged |
| Step | Training Loss | Validation Loss |
|---|---|---|
| 32 | 1.088547 | 1.108700 |
| 64 | 1.098695 | 1.115909 |
| 96 | 1.099704 | 1.114013 |
| 128 | 1.093774 | 1.107312 |
| 160 | 1.087225 | 1.102051 |
| 192 | 1.082110 | 1.098298 |
| 224 | 1.080011 | 1.094395 |
| 256 | 1.075894 | 1.090381 |
| 288 | 1.070766 | 1.085714 |
| 320 | 1.064308 | 1.081495 |
| 352 | 1.064451 | 1.078283 |
| 384 | 1.058922 | 1.074668 |
| 416 | 1.055673 | 1.071584 |
| 448 | 1.050642 | 1.068871 |
| 480 | 1.049796 | 1.066419 |
| 512 | 1.047866 | 1.064614 |
| 544 | 1.046279 | 1.063277 |
| 576 | 1.040401 | 1.062529 |
| 608 | 1.043520 | 1.062152 |
| 640 | 1.045642 | 1.062093 |
| 643 | 1.045642 | 1.062105 |
1tinyllama-ultrachat-rslora/
2|-- adapter/
3| |-- README.md
4| |-- adapter_config.json
5| |-- adapter_model.safetensors
6| |-- chat_template.jinja
7| |-- tokenizer.json
8| |-- tokenizer_config.json
9| `-- training_args.bin
10|-- checkpoint-608/
11| |-- README.md
12| |-- adapter_config.json
13| |-- adapter_model.safetensors
14| |-- chat_template.jinja
15| |-- optimizer.pt
16| |-- rng_state.pth
17| |-- scheduler.pt
18| |-- tokenizer.json
19| |-- tokenizer_config.json
20| |-- trainer_state.json
21| `-- training_args.bin
22|-- checkpoint-640/
23| |-- README.md
24| |-- adapter_config.json
25| |-- adapter_model.safetensors
26| |-- chat_template.jinja
27| |-- optimizer.pt
28| |-- rng_state.pth
29| |-- scheduler.pt
30| |-- tokenizer.json
31| |-- tokenizer_config.json
32| |-- trainer_state.json
33| `-- training_args.bin
34|-- checkpoint-643/
35| |-- README.md
36| |-- adapter_config.json
37| |-- adapter_model.safetensors
38| |-- chat_template.jinja
39| |-- optimizer.pt
40| |-- rng_state.pth
41| |-- scheduler.pt
42| |-- tokenizer.json
43| |-- tokenizer_config.json
44| |-- trainer_state.json
45| `-- training_args.bin
46|-- merged/
47| |-- chat_template.jinja
48| |-- config.json
49| |-- generation_config.json
50| |-- model.safetensors
51| |-- tokenizer.json
52| `-- tokenizer_config.json
53|-- all_results.json
54|-- eval_results.json
55|-- train_results.json
56`-- trainer_state.jsonadapter/ contains the saved PEFT adapter weights and tokenizer files.merged/ contains the fully merged Hugging Face model, including model.safetensors.checkpoint-608/, checkpoint-640/, and checkpoint-643/ are the saved training checkpoints retained by Trainer.