Views
No views yet
MatMulNBitsQuantizer from onnxruntime with block_size=32, symmetric quantization.onnx file (no external data files) for browser compatibility.1import { AutoModelForCausalLM, AutoTokenizer } from "@huggingface/transformers";
2
3const model = await AutoModelForCausalLM.from_pretrained(
4 "shreyask/Maincoder-1B-ONNX-web",
5 { dtype: "q4", device: "webgpu" }
6);
7
8const tokenizer = await AutoTokenizer.from_pretrained(
9 "shreyask/Maincoder-1B-ONNX-web"
10);
11
12const messages = [
13 { role: "system", content: "You are Maincoder, an expert code generation assistant." },
14 { role: "user", content: "Write a binary search function in Python" },
15];
16
17const input = tokenizer.apply_chat_template(messages, {
18 add_generation_prompt: true,
19 return_dict: true,
20});
21
22const output = await model.generate({
23 ...input,
24 max_new_tokens: 1024,
25 eos_token_id: [151643, 151645],
26});