Views
No views yet
1from transformers import AutoTokenizer, AutoModelForCausalLM
2import torch
3
4# Load model and tokenizer
5model_name = "your-username/Llama-3.1-Sherkala-8B-Chat-Quantized-8-Bits"
6tokenizer = AutoTokenizer.from_pretrained(model_name)
7model = AutoModelForCausalLM.from_pretrained(
8 model_name,
9 torch_dtype=torch.float16,
10 device_map="auto",
11 trust_remote_code=True
12)
13
14# Chat template
15def format_chat(messages):
16 return tokenizer.apply_chat_template(
17 messages,
18 tokenize=False,
19 add_generation_prompt=True
20 )
21
22# Example conversation
23messages = [
24 {"role": "user", "content": "Hello! Can you help me with a coding problem?"}
25]
26
27# Generate response
28input_text = format_chat(messages)
29inputs = tokenizer(input_text, return_tensors="pt").to(model.device)
30
31with torch.no_grad():
32 outputs = model.generate(
33 **inputs,
34 max_new_tokens=512,
35 temperature=0.7,
36 do_sample=True,
37 pad_token_id=tokenizer.eos_token_id
38 )
39
40response = tokenizer.decode(outputs[0][inputs.input_ids.shape[1]:], skip_special_tokens=True)
41print(response)| Precision | Memory Usage | Relative Size |
|---|---|---|
| FP16 (Original) | ~16 GB | 100% |
| 8-bit (This model) | ~8 GB | 50% |
1@misc{sherkala-quantized-8bit,
2 title={Llama-3.1-Sherkala-8B-Chat-Quantized-8-Bits},
3 author={InceptionAI},
4 year={2024},
5 note={8-bit quantized version of Llama-3.1-Sherkala-8B-Chat}
6}