Views
No views yet
mlx-lm.
Router classifiers are kept at 8-bit (mixed precision); MTP layers are dropped.model_type: longcat2) support is not yet in a released mlx-lm. Install from
the PR branch:pip install git+https://github.com/ml-explore/mlx-lm.git@refs/pull/1464/head1from mlx_lm import load, generate
2
3model, tokenizer = load("pipenetwork/LongCat-2.0-2bit")
4messages = [{"role": "user", "content": "Who is Albert Einstein?"}]
5prompt = tokenizer.apply_chat_template(messages, add_generation_prompt=True)
6print(generate(model, tokenizer, prompt=prompt, max_tokens=512, verbose=True))mlx.launch + sharded_generate.py).