1sequence_length=256
2auto_cast_type="bf16"
3batch_size=1
4num_cores=2
5hf_repo="yahavb/DeepSeek-R1-Distill-Llama-8B-Neuron"
6model_dir="/deepseek-ai/DeepSeek-R1-Distill-Llama-8B"
7model_id="deepseek-ai/DeepSeek-R1-Distill-Llama-8B"
8
9from huggingface_hub.hf_api import HfFolder
10from huggingface_hub import login
11from optimum.neuron import NeuronModelForCausalLM
12
13login(hf_token,add_to_git_credential=True)
14
15compiler_args = {"num_cores": num_cores, "auto_cast_type": auto_cast_type}
16input_shapes = {"batch_size": batch_size, "sequence_length": sequence_length}
17model = NeuronModelForCausalLM.from_pretrained(
18 model_id,
19 export=True,
20 **compiler_args,
21 **input_shapes)
22model.save_pretrained(model_dir)
23model.push_to_hub(model_dir,repository_id=hf_repo)
1model_id="deepseek-ai/DeepSeek-R1-Distill-Llama-8B"
2hf_repo="yahavb/DeepSeek-R1-Distill-Llama-8B-Neuron"
3max_new_tokens=512
4
5import torch
6from optimum.neuron import NeuronModelForCausalLM
7from transformers import AutoTokenizer
8
9prompt="Who are you? what is the model that powers you?"
10tokenizer = AutoTokenizer.from_pretrained(model_id)
11tokenizer.pad_token_id = tokenizer.eos_token_id if tokenizer.pad_token_id is None else tokenizer.pad_token_id
12inputs = tokenizer(prompt, return_tensors="pt")
13model = NeuronModelForCausalLM.from_pretrained(hf_repo)
14for i in range(10):
15 outputs = model.generate(**inputs,max_new_tokens=max_new_tokens,do_sample=True,use_cache=True,temperature=0.7,top_k=50,top_p=0.9)
16 outputs=outputs[0, inputs.input_ids.size(-1):]
17 response=tokenizer.decode(outputs, skip_special_tokens=True)
18 print(response)