Beta
Explore
Marketplace
Neural Labs
Chat
Wallet
Docs
assn2-sft-qwen2.5-1.5b-lora – AI Model by Riacrdo | AlphaNeural AI
You can deploy this model and start earning money today!
Riacrdo
/
assn2-sft-qwen2.5-1.5b-lora
like
0
safetensors
qwen2
openrlhf
lora
sft
mathematical-reasoning
Qwen/Qwen2.5-1.5B-Instruct
adapter
apache-2.0
4-bit
bitsandbytes
us
Views
No views yet
Model card
Files and Versions
Community
API
Deploy
assn2-sft-qwen2.5-1.5b-lora
This repository contains the SFT LoRA adapter trained for CAS4133 Assignment 2.
Base model
Qwen/Qwen2.5-1.5B-Instruct
Evaluation accuracy on 100 held-out GSM8K-style examples
Model
Accuracy
Base
0.69
SFT
0.58
DPO
0.57
SimPO
0.58
Dataset
https://huggingface.co/datasets/Riacrdo/assn2-preference-dataset