Views
No views yet
transformers.js (v3+/V4).| Attribute | Specification |
|---|---|
| Original Model | Qwen/Qwen3Guard-Gen-0.6B |
| Architecture | Causal Language Model (Qwen3) |
| Format | ONNX (Open Neural Network Exchange) |
| Quantization | Q4 (4-bit) (Optimized for CPU/WebGPU) |
transformers.js (v3/v4). It is recommended to use the latest development version for full 4-bit WebGPU acceleration support: npm install @huggingface/transformers@4.0.0-next.3 import { pipeline, env } from 'https://cdn.jsdelivr.net/npm/@huggingface/transformers@4.0.0-next.3';1 async function isWebGPUSupported() {
2 if (!navigator.gpu) return false;
3 try {
4 const adapter = await navigator.gpu.requestAdapter();
5 return !!adapter;
6 } catch (e) { return false; }
7 }
8
9 async function runSafetyCheck(text) {
10 const hasWebGPU = await isWebGPUSupported();
11 console.log(hasWebGPU ? "🚀 WebGPU Accelerated" : "⚠️ WebGPU Unavailable, falling back to CPU");
12
13 try {
14 const classifier = await pipeline('text-generation', 'rogerdeng/Qwen3Guard-0.6B-ONNX-Quantized', {
15 model_file_name: 'model_quantized', // Maps to onnx/model_quantized.onnx
16 device: hasWebGPU ? 'webgpu' : 'cpu'
17 });
18
19 const output = await classifier(text, {
20 max_new_tokens: 15,
21 temperature: 0,
22 use_cache: true, // Crucial for < 1s inference speed
23 });
24
25 const result = output[0].generated_text.toLowerCase();
26 console.log("Safety Assessment:", result);
27
28 return result.includes('unsafe') ? 'Blocked' : 'Allowed';
29 } catch (error) {
30 console.error("Inference failed:", error);
31 }
32 }| Quantization | Execution Device | Inference Latency | Status |
|---|---|---|---|
| INT8 | WebGPU | ~10.0 - 12.0s | ⚠️ Slow (Kernel Fallback) |
| Q4 (Current) | WebGPU | < 1.0s | ✅ Highly Recommended |
| Q4 (Current) | CPU (WASM) | ~15.0s+ | ℹ️ Backup Mode |
Note: These results are based on real-world tests on a MacBook Pro M3 Max using Chrome with WebGPU enabled.