Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer
2import torch
3
4# Load model
5model = AutoModelForCausalLM.from_pretrained(
6 "nbeerbower/A0l-8B-PRUNE",
7 torch_dtype=torch.bfloat16,
8 device_map="auto"
9)
10tokenizer = AutoTokenizer.from_pretrained("nbeerbower/A0l-8B-PRUNE")
11
12# Generate text
13prompt = "The future of AI is"
14inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
15
16outputs = model.generate(
17 **inputs,
18 max_new_tokens=100,
19 temperature=0.7,
20 do_sample=True
21)
22
23print(tokenizer.decode(outputs[0], skip_special_tokens=True))1{
2 "original_model": "schneewolflabs/A0l-12B",
3 "original_params": 12247782400,
4 "pruned_params": 8703462400,
5 "reduction_percent": 28.93,
6 "pruning_type": "depth",
7 "layers_removed": 13,
8 "removed_layer_indices": "13-25"
9}| Component | Original | Pruned | Status |
|---|---|---|---|
| Layers | 40 | 27 | ⚠️ Changed |
| Hidden Size | 5120 | 5120 | ✅ Same |
| Intermediate Size | 14336 | 14336 | ✅ Same |
| Attention Heads | 32 | 32 | ✅ Same |
| KV Heads | 8 | 8 | ✅ Same |
| Vocab Size | 131072 | 131072 | ✅ Same |
Original model: schneewolflabs/A0l-12B
Base architecture: Mistral-Nemo-12B
Pruning method: Depth pruning (layer removal)