RuvLTRA Medium provides the sweet spot between capability and resource usage. Ideal for desktop applications, development workstations, and moderate-scale deployments.
1# Download
2wget https://huggingface.co/ruv/ruvltra-medium/resolve/main/ruvltra-1.1b-q4_k_m.gguf
3
4# Run inference
5./llama-cli -m ruvltra-1.1b-q4_k_m.gguf \
6 -p "Explain quantum computing in simple terms:" \
7 -n 512 -c 8192
1use ruvllm::hub::ModelDownloader;
2
3let path = ModelDownloader::new()
4 .download("ruv/ruvltra-medium", None)
5 .await?;
1from llama_cpp import Llama
2from huggingface_hub import hf_hub_download
3
4model_path = hf_hub_download("ruv/ruvltra-medium", "ruvltra-1.1b-q4_k_m.gguf")
5llm = Llama(model_path=model_path, n_ctx=8192)
1python -m llama_cpp.server \
2 --model ruvltra-1.1b-q4_k_m.gguf \
3 --host 0.0.0.0 --port 8000
1cargo add ruvllm # Rust
2npm install @ruvector/ruvllm # Node.js
1use ruvllm::quantize::turbo_quant::{TurboQuantCompressor, TurboQuantConfig, TurboQuantBits};
2
3let config = TurboQuantConfig {
4 bits: TurboQuantBits::Bit3_5, // 10.7x compression
5 use_qjl: true,
6 ..Default::default()
7};
8let compressor = TurboQuantCompressor::new(config)?;
9let compressed = compressor.compress_batch(&kv_vectors)?;
10let scores = compressor.inner_product_batch_optimized(&query, &compressed)?;