Views
No views yet
| File | Size |
|---|---|
| config.json | 0.00 MB |
| model.onnx | 1200.70 MB |
| special_tokens_map.json | 0.00 MB |
| tokenizer.json | 6.41 MB |
| tokenizer.model | 1.75 MB |
| tokenizer_config.json | 0.00 MB |
1from optimum.onnxruntime import ORTModelForFeatureExtraction
2from transformers import AutoTokenizer
3import torch
4
5# Load model and tokenizer
6model = ORTModelForFeatureExtraction.from_pretrained(
7 "khaangnguyeen/ruri-v3-310m-onnx",
8 provider="CPUExecutionProvider" # or "CUDAExecutionProvider" for GPU
9)
10tokenizer = AutoTokenizer.from_pretrained("khaangnguyeen/ruri-v3-310m-onnx")
11
12# Encode text
13texts = ["Example sentence", "Another example"]
14inputs = tokenizer(texts, padding=True, truncation=True, return_tensors="pt")
15
16# Get embeddings
17with torch.no_grad():
18 outputs = model(**inputs)
19 embeddings = outputs.last_hidden_state.mean(dim=1) # Mean pooling
20
21print(embeddings.shape) # (2, hidden_size)1import onnxruntime as ort
2import numpy as np
3from transformers import AutoTokenizer
4
5# Load tokenizer
6tokenizer = AutoTokenizer.from_pretrained("khaangnguyeen/ruri-v3-310m-onnx")
7
8# Create ONNX Runtime session
9session = ort.InferenceSession("model.onnx")
10
11# Prepare inputs
12text = "Example sentence"
13inputs = tokenizer(text, return_tensors="np", padding=True, truncation=True)
14
15# Run inference
16outputs = session.run(
17 None,
18 {
19 "input_ids": inputs["input_ids"],
20 "attention_mask": inputs["attention_mask"]
21 }
22)
23
24embeddings = outputs[0].mean(axis=1)
25print(embeddings.shape)1@misc{ruri-v3-onnx,
2 author = {khaangnguyeen},
3 title = {Ruri v3 310M ONNX},
4 year = {2025},
5 publisher = {Hugging Face},
6 howpublished = {\url{[https://huggingface.co/khaangnguyeen/ruri-v3-310m-onnx](https://huggingface.co/khaangnguyeen/ruri-v3-310m-onnx)}}
7}