Views
No views yet
| Parameter | Original | Tiny |
|---|---|---|
| Text Model | ||
| num_hidden_layers | 48 | 8 |
| num_local_experts | 16 | 4 |
| num_experts_per_tok | 1 | 1 |
| hidden_size | 5120 | 2048 |
| intermediate_size | 8192 | 3072 |
| intermediate_size_mlp | 16384 | 6144 |
| num_attention_heads | 40 | 16 |
| num_key_value_heads | 8 | 4 |
| layer_types | 48 layers (chunked/full pattern) | 8 layers (maintains 3:1 pattern) |
| Vision Model | ||
| num_hidden_layers | 34 | 6 |
| hidden_size | 1408 | 768 |
| intermediate_size | 5632 | 3072 |
| num_attention_heads | 16 | 12 |
language_model.model.layers.{X}.feed_forward.experts.*language_model.model.layers.{X}.feed_forward.shared_expert.*vision_model.model.layers.{X}.*Llama4ForConditionalGeneration.1from transformers import Llama4ForConditionalGeneration, AutoProcessor
2
3model = Llama4ForConditionalGeneration.from_pretrained(
4 "inference-optimization/Llama-4-Scout-1.7B-0.4B-Instruct",
5 device_map="auto"
6)
7processor = AutoProcessor.from_pretrained("inference-optimization/Llama-4-Scout-1.7B-0.4B-Instruct")
8
9# Text-only input
10text = "Hello, world!"
11inputs = processor.tokenizer(text, return_tensors="pt").to(model.device)
12outputs = model.generate(**inputs, max_new_tokens=20)
13print(processor.tokenizer.decode(outputs[0]))create-tiny-model skill:[transformers] `rope_parameters`'s high_freq_factor field must be greater than low_freq_factor