Views
No views yet
onnxruntime-node/onnxruntime-web, du modèle
IDKiro/sdxs-512-0.9 — utilisé par
le nœud « Texte → image » de Attic,
un studio nodal de traitement audio/créatif.| Fichier | Rôle | Poids | Précision |
|---|---|---|---|
onnx/text_encoder_int8.onnx | Encodeur de texte CLIP (OpenCLIP ViT-H, hidden_size 1024) | ~342 Mo | int8 (quantification dynamique) |
onnx/unet_int8.onnx | UNet de diffusion (0,3 Md paramètres, 3 blocs down/up) | ~330 Mo | int8 (quantification dynamique) |
onnx/vae_decoder.onnx | Décodeur TAESD (AutoencoderTiny, 1,2 M paramètres) | ~5 Mo | fp32 |
tokenizer/tokenizer.json + tokenizer_config.json | Tokenizer CLIP rapide (format tokenizers/Rust) | ~3,6 Mo | — |
openrail++ (CreativeML Open
RAIL++-M). Cette licence autorise l'usage commercial et la redistribution
de dérivés, à condition de retransmettre les mêmes restrictions d'usage
aux utilisateurs en aval (pas de génération de contenu illégal, nuisible,
ou visant à tromper — voir le texte complet de la licence :
https://huggingface.co/spaces/CompVis/stable-diffusion-license/raw/main/license.txt).torch.onnx.export (exporteur legacy TorchScript, opset 17→18),
un composant à la fois (encodeur de texte, UNet, décodeur VAE), à partir des
poids fp32 du pipeline diffusers.text_encoder et unet quantifiés en int8 via
onnxruntime.quantization.quantize_dynamic (~4× plus petit que fp32, sans
réentraînement). Le décodeur TAESD est resté en fp32 (déjà minuscule).alpha_cumprod(999) ≈ 0.00466009508818388 ont été mesurées empiriquement en
instrumentant le scheduler PNDM de référence de diffusers, plutôt que
réimplémentées depuis la théorie — voir le code du nœud Attic
(electron/sdxs-image.cjs) pour l'implémentation JS complète.public/oonx/sdxs-512-texte-image/ (ou tout chemin pointé par le paramètre
« Chemin modèle » du nœud). Utilisable indépendamment d'Attic avec
onnxruntime-node/onnxruntime-web (CPU) et un tokenizer CLIP compatible.