Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model_id = "JongYeop/Mistral-7B-Instruct-v0.2-FP4-W4A4"
4
5# Load tokenizer
6tokenizer = AutoTokenizer.from_pretrained(model_id)
7
8# Load quantized model
9model = AutoModelForCausalLM.from_pretrained(
10 model_id,
11 device_map="auto",
12 torch_dtype="auto"
13)
14
15# Generate text
16messages = [
17 {"role": "user", "content": "What is machine learning?"}
18]
19
20input_ids = tokenizer.apply_chat_template(
21 messages,
22 add_generation_prompt=True,
23 return_tensors="pt"
24).to(model.device)
25
26outputs = model.generate(
27 input_ids,
28 max_new_tokens=256,
29 do_sample=True,
30 temperature=0.7,
31 top_p=0.9,
32)
33
34response = tokenizer.decode(outputs[0][input_ids.shape[-1]:], skip_special_tokens=True)
35print(response)