[!WARNING] Disclaimer: This model is provided for evaluation purposes only. Performance, accuracy, and stability may vary. Use at your own discretion.
nncf.compress_weights with the following parameters:pip install -U "git+https://github.com/huggingface/optimum-intel.git"pip install --pre -U openvino --extra-index-url https://storage.openvinotoolkit.org/simple/wheels/nightly1from transformers import AutoTokenizer
2from optimum.intel.openvino import OVModelForCausalLM
3
4model_id = "OpenVINO/LFM2.5-8B-A1B-int4-ov"
5tokenizer = AutoTokenizer.from_pretrained(model_id)
6model = OVModelForCausalLM.from_pretrained(model_id)
7
8inputs = tokenizer("What is a capital of France?", return_tensors="pt")
9
10outputs = model.generate(**inputs, max_length=200)
11text = tokenizer.batch_decode(outputs)[0]
12print(text)pip install huggingface_hub
pip install --pre -U openvino openvino-tokenizers openvino-genai --extra-index-url https://storage.openvinotoolkit.org/simple/wheels/nightly1import huggingface_hub as hf_hub
2
3model_id = "OpenVINO/LFM2.5-8B-A1B-int4-ov"
4model_path = "LFM2.5-8B-A1B-int4-ov"
5
6hf_hub.snapshot_download(model_id, local_dir=model_path)1import openvino_genai as ov_genai
2
3device = "CPU"
4pipeline_config = {"ATTENTION_BACKEND": "SDPA"}
5pipe = ov_genai.LLMPipeline(model_path, device, **pipeline_config)
6pipe.get_tokenizer().set_chat_template(pipe.get_tokenizer().chat_template)
7print(pipe.generate("What is a capital of France?", max_length=200))