Views
No views yet
architecture: mimo2
q_size=24576 head_dim=192 v_head_dim=128 layers=73 kv_heads=array mtp=3 effective_layers=70
split 70 fused qkv tensors, dropped 36 mtp tensorsFinal estimate: PPL over 584 chunks for n_ctx=512 = 4.0549 +/- 0.02288
llama_print_timings: load time = 191864.40 ms
llama_print_timings: sample time = 0.00 ms / 1 runs ( 0.00 ms per token, inf tokens per second)
llama_print_timings: prompt eval time = 4322704.22 ms / 299008 tokens ( 14.46 ms per token, 69.17 tokens per second)
llama_print_timings: eval time = 0.00 ms / 1 runs ( 0.00 ms per token, inf tokens per second)
llama_print_timings: total time = 4326930.78 ms / 299009 tokensFinal estimate: PPL over 584 chunks for n_ctx=512 = 4.5954 +/- 0.02684
llama_print_timings: load time = 149084.44 ms
llama_print_timings: sample time = 0.00 ms / 1 runs ( 0.00 ms per token, inf tokens per second)
llama_print_timings: prompt eval time = 4160557.52 ms / 299008 tokens ( 13.91 ms per token, 71.87 tokens per second)
llama_print_timings: eval time = 0.00 ms / 1 runs ( 0.00 ms per token, inf tokens per second)
llama_print_timings: total time = 4164868.84 ms / 299009 tokens