Views
No views yet
falcon-q8-lm4.bin (724 MB, single file, everything the engine needs):lm_head int4 — bit-exact argmax vs q8, −34 MB and −half the lm-read
traffic per decode token;| this runtime | original Space (fp32 ONNX/WASM) | |
|---|---|---|
| full detection query | 1.2 s | 7.8–8.7 s |
| decode | 91–95 tok/s | ~8.7 tok/s |
| download | 724 MB | 2.4 GB |
| video keyframes | 2.2–2.5 Hz (≤3 objects) + 30 FPS correlation tracker | — |
'FPQ4' magic + u32 manifest length + JSON manifest + 256-byte-aligned blobs,
absolute offsets — one fetch, sliced straight into GPU buffers:1const head = new DataView(await file.slice(0, 8).arrayBuffer());
2const mlen = head.getUint32(4, true);
3const manifest = JSON.parse(new TextDecoder().decode(
4 await file.slice(8, 8 + mlen).arrayBuffer()));
5// per tensor t: file.slice(t.packed.offset, t.packed.offset + t.packed.length) → writeBufferanyup/segm_head) stay in ONNX
on the demo's segmentation path; detection runs 100% on WGSL.shader-f16 + subgroups — Chrome/Edge 125+).