Views
No views yet
seed=42).| epoch | eval_loss | perplexity |
|---|---|---|
| 1 | 2.3419 | 10.40 |
| 2 | 2.0541 | 7.80 |
| 3 | 2.0292 | 7.61 |
temperature=0.8, top_p=0.9); only the weights differ.Leo, the stars suggest| epochs | 3 |
| effective batch size | 16 (per_device 16 x grad_accum 1) |
| learning rate | 2e-5, linear decay, no warmup |
| optimizer | adamw_torch_fused |
| precision | bf16 |
| max_length | 512 (longest example was 197 tokens; truncation never triggered) |
| optimizer steps | 3708 |
| hardware | 1x RTX 4000 Ada (20 GB) |
| wall time | 22.4 min |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3tok = AutoTokenizer.from_pretrained("VizRohan/qwen3-0.6b-horoscope")
4model = AutoModelForCausalLM.from_pretrained("VizRohan/qwen3-0.6b-horoscope", dtype="auto")
5
6enc = tok("Aries, today", return_tensors="pt")
7out = model.generate(**enc, max_new_tokens=60, do_sample=True,
8 temperature=0.8, top_p=0.9)
9print(tok.decode(out[0], skip_special_tokens=True))