Views
No views yet
| Parameter | Value |
|---|---|
| Base model | mistralai/Mistral-7B-Instruct-v0.3 |
| Method | QLoRA (NF4 4-bit + LoRA) |
| Dataset | 500 custom instruction examples |
| Domain | LLM Architecture |
| LoRA Rank | 64 |
| Trainable Parameters | 2.26% |
| Optimizer | Paged AdamW |
| Learning Rate Schedule | Cosine + 3% warmup |
| Final Training Loss | 1.2629 |
| Training Time | ~3.3 minutes |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2import torch
3
4model_id = "FazeFlynn/mistral-7b-llm-architecture-expert"
5
6tokenizer = AutoTokenizer.from_pretrained(model_id)
7
8model = AutoModelForCausalLM.from_pretrained(
9 model_id,
10 torch_dtype=torch.float16
11)
12
13prompt = "[INST] Explain how KV cache works in transformers [/INST]"
14
15inputs = tokenizer(prompt, return_tensors="pt")
16
17outputs = model.generate(
18 **inputs,
19 max_new_tokens=200
20)
21
22print(tokenizer.decode(outputs[0], skip_special_tokens=True))