Views
No views yet
1import onnxruntime as ort
2from transformers import AutoTokenizer
3import numpy as np
4
5# Load tokenizer
6tokenizer = AutoTokenizer.from_pretrained("your-username/phi-3.5-mini-instruct-onnx")
7
8# Create ONNX Runtime session
9providers = ['CPUExecutionProvider'] # or ['CUDAExecutionProvider'] for GPU
10session = ort.InferenceSession("model.onnx", providers=providers)
11
12# Prepare input
13text = "Hello, how can I help you today?"
14inputs = tokenizer(text, return_tensors="np")
15
16# Run inference
17outputs = session.run(None, {"input_ids": inputs["input_ids"]})1from optimum.onnxruntime import ORTModelForCausalLM
2from transformers import AutoTokenizer
3
4model = ORTModelForCausalLM.from_pretrained("your-username/phi-3.5-mini-instruct-onnx")
5tokenizer = AutoTokenizer.from_pretrained("your-username/phi-3.5-mini-instruct-onnx")
6
7inputs = tokenizer("Hello, how are you?", return_tensors="pt")
8outputs = model.generate(**inputs)
9response = tokenizer.decode(outputs[0], skip_special_tokens=True)
10print(response)model.onnx - Main ONNX model filemodel.onnx_data - Model weights (external data format)tokenizer.json - Fast tokenizerconfig.json - Model configurationspecial_tokens_map.json - Special tokens mappingtokenizer_config.json - Tokenizer configuration1@article{phi3,
2 title={Phi-3 Technical Report},
3 author={Microsoft},
4 year={2024}
5}