Views
No views yet
1from transformers import AutoTokenizer, AutoModelForCausalLM
2import torch
3
4# Load with automatic fp16 support
5tokenizer = AutoTokenizer.from_pretrained("Mostafa8Mehrabi/qwen3-50m-fp16")
6model = AutoModelForCausalLM.from_pretrained(
7 "Mostafa8Mehrabi/qwen3-50m-fp16",
8 torch_dtype=torch.float16, # Explicitly use fp16
9 device_map="auto" # Automatically place on available device
10)
11
12# For GPU inference (recommended)
13# model = model.to("cuda") # if you have a GPU
14
15inputs = tokenizer("Hello, how are you?", return_tensors="pt")
16# Move inputs to same device as model if using GPU
17# inputs = {k: v.to(model.device) for k, v in inputs.items()}
18
19outputs = model.generate(**inputs, max_length=50, do_sample=True, temperature=0.7)
20print(tokenizer.decode(outputs[0], skip_special_tokens=True))| Component | Original | This Model |
|---|---|---|
| Parameters | 637M | ~50M |
| Vocabulary | 151,936 | 50,257 |
| Hidden Size | 1024 | 384 |
| Layers | 28 | 8 |
| Tokenizer | Qwen3 | GPT-2 |
| Precision | FP32 | FP16 |
| Model Size | ~1.2GB | ~100MB |