Views
No views yet

| Feature | Specification |
|---|---|
| Developer | Metanthropic Research |
| Model Architecture | Sparse Mixture-of-Experts (MoE) |
| Total Parameters | 20.9 Billion |
| Active Parameters | 3.6 Billion (per token) |
| Context Window | 128,000 Tokens |
| Precision | BFloat16 (Native) |
| License | Apache 2.0 |
1# Install required backend support for Arvi's architecture
2pip install gpt-oss transformers peft accelerate torch1import torch
2import gpt_oss # Registers the Arvi MoE architecture
3from transformers import AutoModelForCausalLM, AutoTokenizer
4
5# 1. Configuration
6model_id = "metanthropic/arvi-20b"
7
8print(f"🚀 Loading {model_id}...")
9
10# 2. Load Model
11# We recommend BFloat16 for the best balance of speed and precision
12model = AutoModelForCausalLM.from_pretrained(
13 model_id,
14 torch_dtype=torch.bfloat16,
15 trust_remote_code=True, # Required for Arvi architecture
16 device_map="auto"
17)
18
19# 3. Load Tokenizer
20tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
21
22# 4. Generate
23prompt = "Explain the grandfather paradox and potential resolutions."
24inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
25
26with torch.no_grad():
27 outputs = model.generate(
28 **inputs,
29 max_new_tokens=256,
30 temperature=0.7,
31 do_sample=True
32 )
33
34print(tokenizer.batch_decode(outputs, skip_special_tokens=True)[0])1@misc{arvi2025,
2 title={Arvi-20B: High-Efficiency Reasoning Model},
3 author={Metanthropic, Ekjot Singh},
4 year={2025},
5 publisher={Hugging Face}
6}