Zehaztasunen banaketa unsloth/Qwen3.8-27B-NVFP4 erreferentziakoaren berdina
da, moduluz modulu.
Modeloari buruzko informazio osoa — entrenamendu-datuak, hiperparametroak,
prompt-formatuak eta mugak — oinarrizko modeloaren fitxan dago. Hemen
esportazioari dagokiona baino ez.
Egoera: ebaluatu gabe. Ez da benchmarkik exekutatu, ez modelo honekin ez
kuantizatu gabekoarekin.
Zehaztasunen banaketa
Ez da NVFP4 uniformea. Hiru zehaztasunen nahasketa da:
Zehaztasuna
Moduluak
Kop.
NVFP4 w4a4, 16ko taldeak, fp8_e4m3 eskalak
0–55 geruzetako mlp.{gate,up,down}_proj
168
FP8 w8 kanalka / a8 tokenka, dinamikoa
self_attn.{q,k,v,o}_proj, linear_attn.{in_proj_qkv,in_proj_z,out_proj}, lm_head, eta 56–63 geruzetako MLPak
MLPen azken 8 geruzak FP8-n gelditzen dira. Kuantizazioarekiko
sentikorrenak dira; NVFP4 lauarekiko kalitate-alde ia osoa hor dago,
~400 MB-en truke.
GatedDeltaNet-en in_proj_a / in_proj_b ez dira ukitzen. Arreta
linealaren dimentsio baxuko proiekzioak dira (beta eta dt urratsa):
txikiak, eta kuantizatzeak errekurrentzia desegonkortzen du.
NVFP4-k eskala global estatikoak ditu (weight_global_scale,
input_global_scale), eta KV cache FP8-k ere bai, beraz datu errealekin
aurrera-pasadak behar dira. Entrenamendu-corpus beraren 256 lagin erabili
dira (txat-txantiloia jada aplikatuta), 2048 tokenera moztuta, ez ingelesezko
corpus generiko bat: domeinutik kanpo kalibratzeak eskala horiek desdoituta
uzten ditu modeloak eu/es-en ikusiko duenerako.
Padding gabe eta batch_size=1: <pad>-ekin betetzeak aktibazioen
estatistikak kutsatuko lituzke.
Egiaztapena
Tentsore-kopuruak erreferentziako indizearekin alderatuta: zazpi multzoak bat
datoz, 1.968 tentsore eta 21,8 GiB. Sortutako quantization_config unsloth-ena
bezalakoa da eremuz eremu (ignore zerrendako 303 modulu berak, target berak),
salbuespen hauekin:
eremua
unsloth
hemen
version
0.17.2.a20260716
0.18.0
group_1.weights.observer
null
memoryless_minmax
group_1.weights.actorder
"static"
null
Azken biak GPTQ-ren sinadura dira: unsloth-ek NVFP4 taldea soilik pasatu
zuen GPTQ-tik eta FP8a RTN-n utzi. Hemengo bertsioak RTN erabiltzen du multzo
bietan.
Mugak
Oinarrizko modeloaren muga guztiak heredatzen ditu — HiTZ/RAG_eu
benchmarkarekin ebaluatzeko ezintasuna eta epoka bakarra barne. Irakurri
modelo nagusiaren fitxa
erabili aurretik.
Gainera:
Kuantizazioaren degradazioa, neurtu gabea. NVFP4 w4a4-k bf16-rekiko
kalitatea galtzen du; ez da ez perplexitaterik ez benchmarkik exekutatu
esportazio honen gainean.
Kalibrazioa eu/es/en domeinukoa da. Corpus horretatik kanpoko testuetan
(kode-sorkuntza, beste hizkuntza batzuk) eskala estatikoak okerrago egongo
dira doituta.
Ikusmen-bidea bf16-n dago baina egiaztatu gabe — oinarrizko modelotik
heredatua, ez entrenatua ez neurtua.
Hardware-menpekotasuna. Blackwell gabe, NVFP4 kernelik ez: emuladutako
bideak (halakorik badago) askoz motelagoak dira.