Views
No views yet
| Metric | Value |
|---|---|
| Load time | ~18 min |
| Generation speed | ~12 tok/s |
| RAM usage | ~368 GB |
1from mlx_lm import load, generate
2from mlx_lm.sample_utils import make_sampler
3
4model, tokenizer = load("RockTalk/GigaChat3.1-702B-A36B-MLX-4bit")
5sampler = make_sampler(temp=0.7)
6
7messages = [{"role": "user", "content": "Hello!"}]
8prompt = tokenizer.apply_chat_template(messages, add_generation_prompt=True, tokenize=False)
9response = generate(model, tokenizer, prompt=prompt, max_tokens=500, sampler=sampler)
10print(response)mlx_lm's deepseek_v3.py sanitize method — it hardcodes MTP (Multi-Token Prediction) layer removal at layer index 61 (correct for DeepSeek-V3's 61 transformer layers), but GigaChat has 64 transformer layers so the MTP head is at layer 64. The fix:1# In mlx_lm/models/deepseek_v3.py, sanitize() method:
2# Change hardcoded "model.layers.61" to dynamic:
3mtp_prefix = f"model.layers.{self.args.num_hidden_layers}"tokenizer_class was also patched from TokenizersBackend (transformers v5) to PreTrainedTokenizerFast.