Views
No views yet
| Architecture | Mixture-of-Experts (MoE) |
| Total Parameters | 74B |
| Activated Parameters | 15B |
| Number of Layers (Dense layer included) | 50 |
| Number of Dense Layers | 4 |
| Number of MTP Modules | 1 |
| Hidden Dimension | 4608 |
| MoE Hidden Dimension (per Expert) | 1280 |
| Attention Mechanism | GQA |
| Number of Attention Heads | 64 |
| Number of Query Groups | 4 |
| Number of Experts | 80 |
| Selected Experts per Token | 8 |
| Number of Shared Experts | 2 |
| Vocabulary Size | 153K |
| Context Length | 128K |
| 测评集 | 测评指标 | openPangu-R-72B-2512 快思考 | openPangu-R-72B-2512 慢思考 |
|---|---|---|---|
| 通用能力 | |||
| LiveBench | Acc (2024-11-25) | 67.3 | 75.2 |
| MMLU-Pro | Exact Match | 84.2 | 84.8 |
| MMLU-ProX | Acc | 76.9 | 80.6 |
| RULER | Acc | 95.6 | 94.7 |
| LongBench V2 | Acc | 45.3 | 55.3 |
| IF-Eval | Prompt Strict | 86.3 | 79.1 |
| Hallucination-LeaderBoard | 1-HHEM | 96.5 | 97.1 |
| GPQA-Dimaond | Avg@4 | 76.8 | 83.2 |
| SuperGPQA | Acc | 58.9 | 64.2 |
| 数学能力 | |||
| AIME24 | Avg@16 | 75.6 | 89.0 |
| AIME25 | Avg@16 | 60.6 | 81.3 |
| CNMO 2024 | Avg@32 | 77.8 | 82.8 |
| HMMT 2025 | Avg@16 (February) | 45.4 | 74.8 |
| 代码能力 | |||
| LiveCodeBench V6 | Avg@3 (01/25~05/25) | 41.9 | 69.5 |
| Codeforces | Elo Avg@3 (02/25~09/25) | 1044.5 | 1701.4 |
| Agent工具调用 | |||
| BFCL-V3 | Acc (Prompt) | 74.6 | 76.5 |
| Tau-Bench (airline) | Avg@3 (FC) | 45.3 | 56.0 |
| Tau-Bench (retail) | Avg@3 (FC) | 70.1 | 73.0 |
| Tau2-Bench (airline) | Avg@3 (FC) | 58.0 | 65.3 |
| Tau2-Bench (retail) | Avg@3 (FC) | 71.4 | 78.7 |
| Tau2-Bench (telecom) | Avg@3 (FC) | 48.8 | 49.4 |
| AceBench | Acc (Prompt) | 74.3 | 79.6 |