1---
2library_name: pytorch
3tags:
4 - llama
5 - causal-lm
6 - text-generation
7 - pruning
8 - knowledge-distillation
9 - speedup
10license: apache-2.0
11dataset: slimpajama-test
12pipeline_tag: text-generation
13---
1from transformers import AutoModelForCausalLM, AutoTokenizer
2tok = AutoTokenizer.from_pretrained('hawada/Llama-3.2-1B-h100-slim')
3mdl = AutoModelForCausalLM.from_pretrained('hawada/Llama-3.2-1B-h100-slim', torch_dtype='auto').eval()
4x = tok('Hello', return_tensors='pt')
5print(tok.decode(mdl.generate(**x, max_new_tokens=16)[0]))
1{
2 "base_id": "meta-llama/Llama-3.2-1B",
3 "variant": "slim-export",
4 "repo_slim": "hawada/Llama-3.2-1B-h100-slim"
5}