Views
No views yet
| Datei | Größe | Einsatz |
|---|---|---|
onnx/model_fp16.onnx | ~1.1 GB | WebGPU (Chrome/Edge, teils Safari) |
onnx/model_quantized.onnx | ~536 MB | WASM-Fallback (alle Browser) |
FP32 wird bewusst nicht mitgeliefert (>2 GB, über der Protobuf-Grenze — müsste als External-Data-File geteilt werden, was Transformers.js komplizierter macht). Für Server-seitige Inferenz mit vollem FP32 → Original-Repo nutzen.
1import { pipeline } from "@huggingface/transformers";
2
3const ner = await pipeline(
4 "token-classification",
5 "YOUR_USERNAME/xlm-roberta-large-ner-hrl-onnx",
6 { dtype: "fp16", device: "webgpu" } // schnell auf WebGPU
7 // oder: { dtype: "q8", device: "wasm" } // überall lauffähig
8);
9
10const result = await ner("Max Mustermann arbeitet bei Siemens in München.");
11console.log(result);
12// [
13// { entity: 'B-PER', word: '▁Max', ... },
14// { entity: 'I-PER', word: '▁Must', ... },
15// { entity: 'I-PER', word: 'er', ... },
16// { entity: 'I-PER', word: 'mann', ... },
17// { entity: 'B-ORG', word: '▁Siemens', ... },
18// { entity: 'B-LOC', word: '▁München', ... }
19// ]optimum-cli export onnx --model Davlan/xlm-roberta-large-ner-hrl --task token-classification --opset 17onnxconverter_common.float16.convert_float_to_float16(model, keep_io_types=True, disable_shape_infer=True)onnxruntime.quantization.quantize_dynamic(..., weight_type=QInt8, per_channel=True, reduce_range=True)