Views
No views yet
NNCF. It is designed for high-efficiency local inference on Intel hardware.bash pip install "optimum-intel[openvino,nncf]" transformers 1from optimum.intel import OVModelForCausalLM
2from transformers import AutoTokenizer
3
4model_id = "Your_Username/Gemma-2-2B-IT-OpenVINO-INT4"
5tokenizer = AutoTokenizer.from_pretrained(model_id)
6model = OVModelForCausalLM.from_pretrained(model_id)
7
8# Gemma 2 Chat Template Handshake
9messages = [
10 {"role": "user", "content": "Explain the advantages of INT4 quantization."},
11]
12input_ids = tokenizer.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt")
13
14outputs = model.generate(input_ids, max_new_tokens=256)
15print(tokenizer.decode(outputs[0], skip_special_tokens=True))1<bos><start_of_turn>user
2{prompt}<end_of_turn>
3<start_of_turn>model| Platform | Support Link |
|---|---|
| Global & India | Support via Razorpay |
