Views
No views yet
| Format | Location | Use Case |
|---|---|---|
| SafeTensors | / (root) | Python/PyTorch inference |
| ONNX | /onnx/model.onnx | Full precision ONNX Runtime |
| ONNX Quantized | /onnx/model_quantized.onnx | Browser inference (transformers.js) |
Note: If quantization fails during export due to weight distribution issues,model_quantized.onnxwill be a copy of the fp16 model for compatibility.
1import { pipeline } from "@huggingface/transformers";
2
3const generator = await pipeline(
4 "text-generation",
5 "justinthelaw/SmolLM2-360M-Instruct_Resume-SFT-DPO",
6 { dtype: "q8" } // Uses model_quantized.onnx
7);
8
9const output = await generator("What is Justin's background?", {
10 max_new_tokens: 256,
11 temperature: 0.7,
12});1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained("justinthelaw/SmolLM2-360M-Instruct_Resume-SFT-DPO")
4tokenizer = AutoTokenizer.from_pretrained("justinthelaw/SmolLM2-360M-Instruct_Resume-SFT-DPO")
5
6prompt = "What is Justin's background?"
7inputs = tokenizer(prompt, return_tensors="pt")
8outputs = model.generate(**inputs, max_new_tokens=256)
9print(tokenizer.decode(outputs[0], skip_special_tokens=True))