Views
No views yet
pip install optimum-neuron transformers huggingface_hub1from huggingface_hub import hf_hub_download
2
3# Download and execute the custom module to register model classes
4exec(open(hf_hub_download("YOUR_USERNAME/ministral3-neuron", "ministral3_neuron.py")).read())
5
6# Load model and tokenizer
7model, tokenizer = load_ministral3("YOUR_USERNAME/ministral3-neuron")
8
9# Generate text
10inputs = tokenizer("What is 2+2?", return_tensors="pt")
11outputs = model.generate(**inputs, max_new_tokens=50)
12print(tokenizer.decode(outputs[0], skip_special_tokens=True))1from huggingface_hub import hf_hub_download
2
3# First, register the custom model classes
4exec(open(hf_hub_download("YOUR_USERNAME/ministral3-neuron", "ministral3_neuron.py")).read())
5
6# Then load using optimum-neuron
7from optimum.neuron import NeuronModelForCausalLM
8from transformers import AutoTokenizer
9
10model = NeuronModelForCausalLM.from_pretrained("YOUR_USERNAME/ministral3-neuron")
11tokenizer = AutoTokenizer.from_pretrained("YOUR_USERNAME/ministral3-neuron")
12
13# Generate
14inputs = tokenizer("Hello, how are you?", return_tensors="pt")
15outputs = model.generate(**inputs, max_new_tokens=100)
16print(tokenizer.decode(outputs[0], skip_special_tokens=True))ministral3_neuron.py file before loading. This file registers the Ministral3 model architecture in optimum-neuron's model registry.1{
2 "batch_size": 1,
3 "sequence_length": 4096,
4 "tp_degree": 2,
5 "torch_dtype": "bfloat16",
6 "on_device_sampling": true,
7 "fused_qkv": true
8}model.pt - Compiled Neuron model with weightsconfig.json - Model configurationneuron_config.json - Neuron compilation configurationministral3_neuron.py - Custom code for model registrationtokenizer.json, tokenizer_config.json, special_tokens_map.json - Tokenizer fileschat_template.jinja - Chat template