1optimizer:
2 class_path: torch.optim.AdamW
3 init_args:
4 lr: 0.0005
5 weight_decay: 0.01
6precision: bf16-mixed
7seed: 42
8train:
9 global_batch_size: 1024
10 max_seq_length: 2048
11 max_tokens: 600000000000
12 micro_batch_size: 8
13
This repository hosts multiple revisions of the model.
To load a specific revision, use the revision parameter. For example:
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained("locuslab/mixed_tokenization-600B-step-180000", revision="final")
4tokenizer = AutoTokenizer.from_pretrained("locuslab/mixed_tokenization-600B-step-180000", revision="final")