Views
No views yet
meta-llama/Meta-Llama-3.1-8B-Instruct| Category | Value |
|---|---|
| Batch size (train/eval) | 8 / 8 |
| Gradient accumulation | 2 |
| Warmup ratio | 0.05 |
| Weight decay | 0.01 |
| Max grad norm | 1.0 |
| Dropout (LoRA) | 0.05 |
| Learning rate scheduler | Cosine |
| Save/eval frequency | Every 200 steps |
| Total checkpoints kept | 5 |
| Logging | W&B (llama-3.1-8b-finetune) |
| Optimizer | AdamW (β₁ = 0.9, β₂ = 0.999, ε = 1e-8) |
| Quantization | 8-bit with llm_int8_threshold = 6.0 |
| Mixed precision | bf16 (True) |
1from transformers import AutoTokenizer, AutoModelForCausalLM
2
3model_id = "somieee20/llama-3.1-8b-linkedin"
4tokenizer = AutoTokenizer.from_pretrained(model_id)
5model = AutoModelForCausalLM.from_pretrained(model_id)
6
7prompt = "Write a viral LinkedIn post about learning from startup failures."
8inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
9outputs = model.generate(**inputs, max_new_tokens=300, temperature=0.8, do_sample=True)
10print(tokenizer.decode(outputs[0], skip_special_tokens=True))