Views
No views yet
LiquidAI/LFM2.5-1.2B-JP-202606 (~1.16 GB).LiquidAI/LFM2.5-1.2B-JP-202606 ties embed_tokens with the LM head, so a uniform low-bit quant would degrade both the input lookup and the output logits.pip install mlx-lm1from mlx_lm import load, generate
2
3model, tokenizer = load("LiquidAI/LFM2.5-1.2B-JP-202606-MLX-8bit")
4messages = [{"role": "user", "content": "日本の首都はどこですか?"}]
5prompt = tokenizer.apply_chat_template(messages, add_generation_prompt=True)
6print(generate(model, tokenizer, prompt, max_tokens=128, verbose=True))