Views
No views yet
| Компонент | Версия |
|---|---|
| SageAttention | 2.2.0 (commit d1a57a5, ветка main) |
| PyTorch | 2.10.0 |
| CUDA | 13.0 |
| Python | cp312 |
| Архитектуры | 8.0;8.6;8.9;9.0;10.0;12.0;12.1 |
| Платформа | linux x86_64 |
pip install https://huggingface.co/whitmoree530/BC/resolve/main/sageattention-2.2.0+cu130torch2.10.0sm80.86.89.90.100.120.121-cp312-cp312-linux_x86_64.whlmain; сборка с abi3_stable переживает любой torch >= 2.10.
Колесо содержит ядра только для перечисленных выше архитектур — на других
картах импорт пройдёт, а первый вызов упадёт или даст чёрный кадр.1import torch
2from sageattention import sageattn
3q, k, v = (torch.randn(1, 8, 512, 128, dtype=torch.float16, device="cuda") for _ in range(3))
4out = sageattn(q, k, v, tensor_layout="HND", is_causal=False)
5ref = torch.nn.functional.scaled_dot_product_attention(q, k, v)
6print(torch.isfinite(out).all().item(), (out - ref).abs().max().item())--use-sage-attention (он поднимает Triton-бэкенд, на части
моделей даёт чёрный кадр), а нодой Patch Sage Attention KJ из KJNodes,
backend sageattn_qk_int8_pv_fp16_cuda.