Views
No views yet
facebook/sam2.1-hiera-tiny
(Meta, Apache-2.0) für onnxruntime-web. Exportiert mit einem
veröffentlichten Skript und gegen die PyTorch-Referenz nachgemessen.| Datei | Format | Größe |
|---|---|---|
sam2.1-tiny-encoder.ort | ORT | 134,7 MB |
sam2.1-tiny-decoder.onnx | ONNX | 16,6 MB |
.pt. Die im Netz auffindbaren
ONNX-Exporte sind Re-Uploads ohne dokumentiertes Verfahren. Eine Prüfsumme
sichert, dass sich eine Datei nach dem ersten Abruf nicht mehr ändert — über
ihren Ursprung sagt sie nichts. Und dieses Modell läuft im Browser von
Endnutzern.image_embed gegen die
PyTorch-Referenz, gleicher Reiz, feste Saat:| mittlere Abweichung | größte | |
|---|---|---|
| dieser Export | 0.000001 | 0.000014 |
| ein kursierender Fremd-Export | 0.005858 | 0.175503 |
no_mem_embed liegt sie mit 0.013 noch weiter daneben). Sie liefert
plausible Masken und besteht deshalb oberflächliche Tests, rechnet aber
nachweislich etwas anderes als SAM 2.1.compare_reference.py im Export-Werkzeug.onnxruntime-web an
der Shape-Inferenz (Inferred=4 Declared=5), an mehreren unabhängigen
Exporten verifiziert. Das ORT-Format trägt die aufgelösten Shapes in sich.high_res_feats_0/1, mask_input und has_mask_input;
has_mask_input muss ein Tensor sein, kein Python-Zweig, sonst backt der
Export einen der beiden Fälle fest.image [1,3,1024,1024], ImageNet-normiert →
image_embed [1,256,64,64], high_res_feats_0 [1,32,256,256],
high_res_feats_1 [1,64,128,128]point_coords [1,N,2] (im
1024er-Pixelraum), point_labels [1,N], mask_input [1,1,256,256],
has_mask_input [1] → masks [1,3,256,256], iou_predictions [1,3]N ist dynamisch: mehrere Klicks verfeinern dieselbe Maske in einem Lauf.onnxruntime-web auf wasm mit 4 Threads: Encoder 2747 ms,
Klick-Decode kalt 74 ms, warm 49 ms. Auf einer Kontrollszene trifft die Maske
38007 px bei 38013 px Sollfläche.