Views
No views yet
Qwen/Qwen3-0.6B) to use it — see the loading instructions below.| Dataset | Rows used | Purpose |
|---|---|---|
| Gugu8/Math-Dataset | 25,000 | Math word problems + reasoning |
| Gugu8/CoT-for-LLM | 25,000 | General chain-of-thought reasoning |
| Gugu8/English | 12,000 | General English fluency (sentences, grammar, narrative) |
q/k/v/o_proj, gate/up/down_proj)accelerate launch (DDP)1from transformers import AutoModelForCausalLM, AutoTokenizer
2from peft import PeftModel
3import torch
4
5base_model_id = "Qwen/Qwen3-0.6B"
6adapter_id = "Gugu8/<your-repo-name>" # replace with your actual repo path
7
8tokenizer = AutoTokenizer.from_pretrained(adapter_id)
9base_model = AutoModelForCausalLM.from_pretrained(
10 base_model_id,
11 torch_dtype=torch.bfloat16,
12 device_map="auto",
13)
14model = PeftModel.from_pretrained(base_model, adapter_id)
15
16messages = [{"role": "user", "content": "What is 24% of 350?"}]
17inputs = tokenizer.apply_chat_template(
18 messages, tokenize=True, add_generation_prompt=True, return_tensors="pt"
19).to(model.device)
20
21with torch.no_grad():
22 out = model.generate(inputs, max_new_tokens=200, do_sample=False)
23
24print(tokenizer.decode(out[0][inputs.shape[1]:], skip_special_tokens=True))Calculate 24/100 * 350 = 0.24*350 = 84. Answer: 84LICENSE file in this repository for the full text.