Views
No views yet
| Version | Model Size | GPU VRAM Usage | Parameters | Relative Performance |
|---|---|---|---|---|
| Original (DeepSeek-Coder-6.7B) | 3.51GB | 7.85GB | 6.7B | 100% |
| Optimized (DeepSeek-Light-V1) | 3.51GB | 3.93GB (50% reduction!) | 3.5B | ~50% performance |
transformers with quantization:1from transformers import AutoModelForCausalLM, AutoTokenizer, BitsAndBytesConfig
2import torch
3
4# Load model and tokenizer
5model_name = "sanchezalonsodavid17/DeepSeek_Light_V1"
6tokenizer = AutoTokenizer.from_pretrained(model_name, trust_remote_code=True)
7
8quantization_config = BitsAndBytesConfig(
9 load_in_4bit=True,
10 bnb_4bit_quant_type="nf4",
11 bnb_4bit_compute_dtype=torch.bfloat16,
12 bnb_4bit_use_double_quant=True,
13)
14
15model = AutoModelForCausalLM.from_pretrained(
16 model_name,
17 device_map="auto",
18 quantization_config=quantization_config
19)
20
21# Generate text
22def generate_text(prompt, max_length=100):
23 inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
24 with torch.no_grad():
25 output = model.generate(**inputs, max_length=max_length)
26 return tokenizer.decode(output[0], skip_special_tokens=True)
27
28# Example usage
29prompt = "Explain how deep learning works in neural networks."
30response = generate_text(prompt)
31print(response)