Views
No views yet
1# pip install transformers accelerate
2from transformers import AutoTokenizer, AutoModelForCausalLM
3
4tokenizer = AutoTokenizer.from_pretrained("neuralmagic/Llama-2-7b-pruned70-retrained-ultrachat")
5model = AutoModelForCausalLM.from_pretrained("neuralmagic/Llama-2-7b-pruned70-retrained-ultrachat", device_map="auto")
6
7input_text = "Write me a poem about Machine Learning."
8input_ids = tokenizer.apply_chat_template(input_text, add_generation_prompt=True, return_tensors="pt").to("cuda")
9
10outputs = model.generate(**input_ids)
11print(tokenizer.decode(outputs[0]))| Benchmark | Metric | Llama-2-7b-ultrachat | Llama-2-7b-pruned70-retrained-ultrachat |
|---|---|---|---|
| MMLU | 5-shot | 46.1% | 32.5% |
| HellaSwag | 0-shot | 75.9% | 68.9% |
| WinoGrande | 5-shot | 72.6% | 65.1% |
| ARC-c | 25-shot | 52.8% | 45.3% |
| TruthfulQA | 5-shot | 44.8% | 39.6% |
| GSM8K | 5-shot | 12.4% | 4.8% |
| AlpacaEval (Llama-2-70b-chat-hf evaluator) | Win rate | 57.6% | 57.4% |
| AlpacaEval (GPT-4 Turbo evaluator) | Win rate | 60.6% | 54.0% |