This is a fine-tuned version of DeepSeek-Coder-1.3B-Instruct, specialized for detecting security vulnerabilities in code.
Base Model: deepseek-ai/deepseek-coder-1.3b-instruct Training Data: 440 synthetic vulnerability examples Training Method: LoRA (Low-Rank Adaptation) with 4-bit quantization Training Platform: Google Colab (Free T4 GPU)
Capabilities
The model can detect and analyze:
SQL Injection
Cross-Site Scripting (XSS)
Command Injection / RCE
Insecure Direct Object Reference (IDOR)
Server-Side Request Forgery (SSRF)
Authentication Bypass
Cross-Site Request Forgery (CSRF)
Path Traversal
Training Details
Examples: 440 vulnerability patterns
Epochs: 3
Batch Size: 2 (with gradient accumulation)
Learning Rate: 2e-4
LoRA Rank: 8
Quantization: 4-bit (NF4)
Training Time: ~45-60 minutes on T4 GPU
Usage
python
1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
34# Load base model5base_model ="deepseek-ai/deepseek-coder-1.3b-instruct"6model = AutoModelForCausalLM.from_pretrained(base_model, device_map="auto")7tokenizer = AutoTokenizer.from_pretrained(base_model)89# Load LoRA adapter10model = PeftModel.from_pretrained(model,"YOUR_USERNAME/pentest-vulnerability-detector")1112# Analyze code13code ="SELECT * FROM users WHERE id = 'user_input'"14prompt =f"System: You are a security expert.\n\nUser: Analyze this code:\n{code}\n\nAssistant:"1516inputs = tokenizer(prompt, return_tensors="pt").to(model.device)17outputs = model.generate(**inputs, max_new_tokens=200)18response = tokenizer.decode(outputs[0], skip_special_tokens=True)19print(response)
Inference Script
For easier usage, use the provided inference script: