Views
No views yet
1slices:
2 - sources:
3 - model: NousResearch/Nous-Hermes-2-Yi-34B
4 layer_range: [0, 60]
5 - model: jondurbin/bagel-dpo-34b-v0.2
6 layer_range: [0, 60]
7merge_method: slerp
8base_model: NousResearch/Nous-Hermes-2-Yi-34B
9parameters:
10 t:
11 - filter: self_attn
12 value: [0, 0.5, 0.3, 0.7, 1]
13 - filter: mlp
14 value: [1, 0.5, 0.7, 0.3, 0]
15 - value: 0.5
16dtype: bfloat161!pip install -qU transformers accelerate bitsandbytes
2
3from transformers import (
4 AutoTokenizer,
5 AutoModelForCausalLM,
6 BitsAndBytesConfig
7)
8import torch
9
10model = "dfurman/HermesBagel-34B-v0.1"
11nf4_config = BitsAndBytesConfig(
12 load_in_4bit=True,
13 bnb_4bit_quant_type="nf4",
14 bnb_4bit_use_double_quant=True,
15 bnb_4bit_compute_dtype=torch.bfloat16
16)
17
18tokenizer = AutoTokenizer.from_pretrained(model)
19model = AutoModelForCausalLM.from_pretrained(
20 model,
21 torch_dtype=torch.bfloat16,
22 device_map="auto",
23 quantization_config=nf4_config,
24)1messages = [
2 {"role": "user", "content": "What is a large language model?"},
3]
4
5print("\n\n*** Prompt:")
6input_ids = tokenizer.apply_chat_template(
7 messages,
8 tokenize=True,
9 return_tensors="pt",
10)
11print(tokenizer.decode(input_ids[0]))
12
13print("\n\n*** Generate:")
14with torch.autocast("cuda", dtype=torch.bfloat16):
15 output = model.generate(
16 input_ids=input_ids.to("cuda"),
17 max_new_tokens=256,
18 return_dict_in_generate=True,
19 )
20
21response = tokenizer.decode(
22 output["sequences"][0][len(input_ids[0]):],
23 skip_special_tokens=True
24)
25print(response)| Metric | Value |
|---|---|
| Avg. | 75.15 |
| AI2 Reasoning Challenge (25-Shot) | 70.56 |
| HellaSwag (10-Shot) | 85.74 |
| MMLU (5-Shot) | 77.38 |
| TruthfulQA (0-shot) | 67.34 |
| Winogrande (5-shot) | 84.61 |
| GSM8k (5-shot) | 65.28 |