Views
No views yet
mlx-lm 0.26.4bfloat16 (per config)bits: 4, group_size: 32 for all transformer weightsmodel.embed_tokens: bits 8, group_size 32 (embeddings in 8-bit)quantization and quantization_config for HF compatibility.pip install mlx-lm1from mlx_lm import load, generate
2
3model, tokenizer = load("brabooObrabo/Qwen3-4B-Instruct-2507-MLX-4bit-GS32-embed-8bit-GS32")
4
5prompt = "hello"
6
7if tokenizer.chat_template is not None:
8 messages = [{"role": "user", "content": prompt}]
9 prompt = tokenizer.apply_chat_template(messages, add_generation_prompt=True)
10
11out = generate(model, tokenizer, prompt=prompt, max_tokens=512, temperature=0.7, top_p=0.9, verbose=True)
12print(out)Tune as usual; GS32 + 8-bit embeddings tends to accept slightly lower temps without sounding robotic.