Views
No views yet
steven0226/qwen3vl-8b-chartqa-lora into its Qwen3-VL-8B base. This is the quality reference used before AWQ quantization and the 16-bit serving baseline.2e-4; linear schedule| Split | n | Accuracy |
|---|---|---|
| Human | 1,250 | 77.28% |
| Augmented | 1,250 | 95.20% |
| Overall | 2,500 | 86.24% |
519060ef43df3261e0512e5ae4c82a4d4e675f32.| Concurrency | Output tok/s | TTFT p95 | TPOT p95 | E2E p95 |
|---|---|---|---|---|
| 1 | 67.29 | 160.76 ms | 13.43 ms/tok | 1,007.16 ms |
| 4 | 231.02 | 299.78 ms | 15.04 ms/tok | 1,169.61 ms |
| 8 | 387.58 | 473.68 ms | 18.33 ms/tok | 1,426.90 ms |
| 16 | 595.06 | 806.77 ms | 24.14 ms/tok | 2,005.45 ms |
bench/.0.25.1+cu129 with torch 2.11.0+cu129 on Linux A100.1from vllm import LLM
2
3llm = LLM(
4 model="steven0226/qwen3vl-8b-chartqa-merged-16bit",
5 revision="519060ef43df3261e0512e5ae4c82a4d4e675f32",
6 max_model_len=4096,
7 limit_mm_per_prompt={"image": 1, "video": 0},
8)kuotunyu 與 Hugging Face steven0226 為同一人。kuotunyu and Hugging Face steven0226 are the same author.