Views
No views yet

| Hyperparameter | Value |
|---|---|
| Total parameters | ~398B |
| Active parameters per token | ~13B |
| Experts | 256 (1 shared) |
| Active experts | 4 |
| Routing strategy | 4-of-256 (1.56% sparsity) |
| Dense layers | 6 |
| Pretraining context length | 8,192 |
| Context length after extension | 512k |
| Architecture | Sparse MoE (AfmoeForCausalLM) |
| Benchmark | Llama 4 Maverick | Trinity-Large Preview |
|---|---|---|
| MMLU | 85.5 | 87.2 |
| MMLU-Pro | 80.5 | 75.2 |
| GPQA-Diamond | 69.8 | 63.3 |
| AIME 2025 | 19.3 | 24.0 |


main transformers branch or pass trust_remote_code=True with a released version.1from transformers import AutoTokenizer, AutoModelForCausalLM
2import torch
3
4model_id = "arcee-ai/Trinity-Large-Preview-FP8"
5tokenizer = AutoTokenizer.from_pretrained(model_id)
6model = AutoModelForCausalLM.from_pretrained(
7 model_id,
8 device_map="auto",
9 trust_remote_code=True
10)
11
12messages = [
13 {"role": "user", "content": "Who are you?"},
14]
15
16input_ids = tokenizer.apply_chat_template(
17 messages,
18 add_generation_prompt=True,
19 return_tensors="pt"
20).to(model.device)
21
22outputs = model.generate(
23 input_ids,
24 max_new_tokens=256,
25 do_sample=True,
26 temperature=0.8,
27 top_k=50,
28 top_p=0.8
29)
30
31response = tokenizer.decode(outputs[0], skip_special_tokens=True)
32print(response)1vllm serve arcee-ai/Trinity-Large-Preview-FP8 \
2 --enable-auto-tool-choice \
3 --tool-call-parser hermes1curl -X POST "https://openrouter.ai/v1/chat/completions" \
2 -H "Authorization: Bearer $OPENROUTER_API_KEY" \
3 -H "Content-Type: application/json" \
4 -d '{
5 "model": "arcee-ai/trinity-large-preview",
6 "messages": [
7 {
8 "role": "user",
9 "content": "What are some fun things to do in New York?"
10 }
11 ]
12 }'1@misc{arcee_trinity_large_preview,
2 title = {Trinity-Large-Preview},
3 author = {{Arcee AI}},
4 year = {2026},
5 note = {398B sparse MoE model trained on 17T tokens}
6}