Views
No views yet
| Attribute | Value |
|---|---|
| Original Model | EuroLLM-22B-Instruct-2512 |
| Quantization | GPTQ 4-bit |
| Group Size | 128 |
| Activation Order | desc_act=True |
| Calibration Samples | 512 |
| Sequence Length | 1024 |
| Calibration Dataset | OpenHermes-2.5 (ChatML format) |
| Size | ~14GB |
1{
2 "bits": 4,
3 "group_size": 128,
4 "desc_act": true,
5 "damp_percent": 0.01,
6 "sym": true,
7 "true_sequential": true
8}1from gptqmodel import GPTQModel
2from transformers import AutoTokenizer
3
4model = GPTQModel.load("Euraika/EuroLLM-22B-Instruct-GPTQ", device="cuda:0")
5tokenizer = AutoTokenizer.from_pretrained("Euraika/EuroLLM-22B-Instruct-GPTQ")
6
7prompt = """<|im_start|>system
8You are a helpful AI assistant.<|im_end|>
9<|im_start|>user
10Explain quantum computing in simple terms.<|im_end|>
11<|im_start|>assistant
12"""
13
14inputs = tokenizer(prompt, return_tensors="pt").to("cuda:0")
15outputs = model.generate(**inputs, max_new_tokens=256, temperature=0.7, top_p=0.9)
16print(tokenizer.decode(outputs[0], skip_special_tokens=True))1from vllm import LLM, SamplingParams
2
3llm = LLM(model="Euraika/EuroLLM-22B-Instruct-GPTQ", quantization="gptq")
4sampling_params = SamplingParams(temperature=0.7, top_p=0.9, max_tokens=256)
5
6outputs = llm.generate(["Your prompt here"], sampling_params)1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "Euraika/EuroLLM-22B-Instruct-GPTQ",
5 device_map="auto"
6)
7tokenizer = AutoTokenizer.from_pretrained("Euraika/EuroLLM-22B-Instruct-GPTQ")<|im_start|>system
{system_message}<|im_end|>
<|im_start|>user
{user_message}<|im_end|>
<|im_start|>assistant
{assistant_message}<|im_end|>