Views
No views yet
| Benchmark | Ling-flash-2.0 | LLaDA2.0-mini-preview | LLaDA2.0-flash-preview |
|---|---|---|---|
| Average | 79.93 | 66.89 | 77.03 |
| Knowledge | |||
| MMLU | 87.98 | 72.49 | 83.15 |
| MMLU-PRO | 76.84 | 49.22 | 66.16 |
| CMMLU | 86.59 | 67.53 | 79.64 |
| C-EVAL | 88.03 | 66.54 | 79.28 |
| Reasoning | |||
| squad2.0 | 81.32 | 85.61 | 90.61 |
| drop | 88.32 | 79.49 | 88.17 |
| korbench | 68.96 | 37.26 | 53.28 |
| Coding | |||
| CruxEval-O | 82.75 | 61.88 | 74.50 |
| mbpp | 85.01 | 77.75 | 86.65 |
| MultiPL-E | 65.76 | 62.43 | 72.38 |
| humaneval | 85.98 | 80.49 | 88.41 |
| Bigcodebench-Full | 40.70 | 30.44 | 40.44 |
| Math | |||
| GSM8K | 95.45 | 89.01 | 95.75 |
| math | 96.1 | 73.50 | 83.52 |
| Agent & Alignment | |||
| BFCL_Live | 67.57 | 74.11 | 74.86 |
| IFEval-strict -prompt | 81.52 | 62.50 | 75.60 |
| Model ID | Description | Hugging Face Link |
|---|---|---|
inclusionAI/LLaDA2.0-mini-preview | Instruction-tuned model, ready for downstream applications. | 🤗 Model Card |
inclusionAI/LLaDA2.0-flash-preview | Instruction-tuned model, ready for downstream applications. | 🤗 Model Card |
transformers and its dependencies installed:1import torch
2import torch.nn.functional as F
3from transformers import AutoModelForCausalLM
4from transformers import AutoTokenizer
5
6model_path = "/path/to/LLaDA2.0-mini-preview"
7device = "auto"
8model = AutoModelForCausalLM.from_pretrained(
9 model_path, trust_remote_code=True, device_map=device
10)
11model = model.to(torch.bfloat16)
12model.eval()
13tokenizer = AutoTokenizer.from_pretrained(model_path, trust_remote_code=True)
14
15prompt = "Why does Camus think that Sisyphus is happy?"
16input_ids = tokenizer.apply_chat_template(
17 [{"role": "user", "content": prompt}],
18 add_generation_prompt=True,
19 tokenize=True,
20 return_tensors="pt",
21)
22generated_tokens = model.generate(
23 inputs=input_ids,
24 eos_early_stop=True,
25 gen_length=512,
26 block_length=32,
27 steps=32,
28 temperature=0.0,
29)
30generated_answer = tokenizer.decode(
31 generated_tokens[0],
32 skip_special_tokens=True,
33)
34print(generated_answer)Temperature=0.0, block_length=32, and steps=32. Using a higher temperature value may occasionally result in language mixing and a slight decrease in model performance.