Views
No views yet
| Formato | Throughput (tok/s) | Peak VRAM (GB) | Mejora Speed |
|---|---|---|---|
| Original (FP16) | 7.0 | 15.9 | 1.0x |
| TurboQuant (INT4) | 7.3 | 17.2 | 1.04x |
| ONNX OGA (q4) | ~8.8 | ~13.8 | 1.25x |
/onnx.1import onnxruntime_genai as ogai
2
3# Cargar modelo desde la subcarpeta onnx
4model = ogai.Model("path/to/repo/onnx")
5tokenizer = ogai.Tokenizer(model)
6
7# Inferencia Multimodal
8params = ogai.GeneratorParams(model)
9prompt = "<image>\nDescribe esta imagen."
10input_tokens = tokenizer.encode(prompt)
11params.input_ids = input_tokens
12
13# Generar
14generator = ogai.Generator(model, params)
15while not generator.is_done():
16 generator.compute_next_token()
17 print(tokenizer.decode(generator.get_next_tokens()), end="")1# El modelo acepta tokens <audio> directamente en el prompt
2prompt = "<audio>\nTranscribe y resume este clip de audio."model.safetensors: Pesos empaquetados TurboQuant (INT4)./onnx: Bundle completo para ONNX Runtime GenAI (incluye vision y audio encoders).config.json: Configuración de arquitectura Gemma 4.