1compiler_args = {"num_cores": 2, "auto_cast_type": auto_cast_type}
2input_shapes = {"batch_size": 1, "sequence_length": 32}1import torch
2from optimum.neuron import NeuronModelForCausalLM
3from transformers import AutoTokenizer
4model_id="deepseek-ai/DeepSeek-R1-Distill-Llama-8B"
5prompt="What is is the capital of France?"
6tokenizer = AutoTokenizer.from_pretrained(model_id)
7tokenizer.pad_token_id = tokenizer.eos_token_id if tokenizer.pad_token_id is None else tokenizer.pad_token_id
8inputs = tokenizer(prompt, return_tensors="pt")
9model = NeuronModelForCausalLM.from_pretrained("yahavb/deepseek-r1-distill-llama-8b-2ndcore-neuron")
10outputs = model.generate(**inputs,max_new_tokens=512,do_sample=True,use_cache=True,temperature=0.7,top_k=50,top_p=0.9)
11outputs=outputs[0, inputs.input_ids.size(-1):]
12response=tokenizer.decode(outputs, skip_special_tokens=True)
13print(response)