Views
No views yet
1from unsloth import FastLanguageModel
2from transformers import TextStreamer
3
4# Load model with Unsloth (automatically handles 2M context!)
5model, tokenizer = FastLanguageModel.from_pretrained(
6 model_name="codelion/qwen2-5-coder-0-5b-instruct-progressive-2000k-lora",
7 max_seq_length=2000000,
8 dtype=None, # Auto-detect
9 load_in_4bit=True,
10)
11
12# Enable native fast generation
13FastLanguageModel.for_inference(model)
14
15# Example: Analyze a large codebase
16prompt = """Repository Context:
17[Your repository content up to 2000K tokens]
18
19Question: Analyze the overall architecture and provide improvement suggestions.
20
21Answer:"""
22
23inputs = tokenizer(prompt, return_tensors="pt", truncation=True, max_length=2000000)
24streamer = TextStreamer(tokenizer)
25
26outputs = model.generate(
27 **inputs,
28 streamer=streamer,
29 max_new_tokens=1024,
30 temperature=0.7,
31 do_sample=True
32)1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3import torch
4
5# Load base model
6model = AutoModelForCausalLM.from_pretrained(
7 "Qwen/Qwen2.5-Coder-0.5B-Instruct",
8 torch_dtype=torch.bfloat16,
9 device_map="auto",
10 trust_remote_code=True,
11 attn_implementation="flash_attention_2"
12)
13
14# Load tokenizer
15tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen2.5-Coder-0.5B-Instruct")
16
17# Load the progressive adapter
18model = PeftModel.from_pretrained(model, "codelion/qwen2-5-coder-0-5b-instruct-progressive-2000k-lora")
19
20# Now you can use contexts up to 2000K tokens!1Progressive Stages: 32K → 128K → 512K → 2000K
2Final Context: 2000K tokens
3Base Model: Qwen/Qwen2.5-Coder-0.5B-Instruct
4Data Generation: vLLM (fast batch inference)
5Training: Unsloth (memory-efficient training)
6LoRA Rank: 64
7LoRA Alpha: 128
8Learning Rate: 0.0002
9Batch Size: 1
10Gradient Accumulation: 4