Views
No views yet
TinyMoE-200m-2x16 (Mixtral architecture) optimized for chat and instruction following using LoRA.1User: [Your message here]
2Assistant:
31User: [User message 1]
2Assistant: [Model response 1]
3User: [User message 2]
4Assistant:
51from transformers import AutoTokenizer, AutoModelForCausalLM
2
3model_id = "FlameF0X/TinyChat-200m-2x16"
4tokenizer = AutoTokenizer.from_pretrained(model_id)
5model = AutoModelForCausalLM.from_pretrained(model_id)
6
7prompt = "User: Explain how MoE works.\nAssistant:"
8
9inputs = tokenizer(prompt, return_tensors="pt")
10outputs = model.generate(**inputs, max_new_tokens=100)
11print(tokenizer.decode(outputs[0], skip_special_tokens=True))
12messages format and rendered into the simple User: ... / Assistant: ... text style shown above.transformers + peft