1attention_logit_softcapping: null
2attention_scores_scalar: null
3attn_bias: false
4bias: false
5block_size: 8192
6final_logit_softcapping: null
7gelu_approximate: none
8head_size: 64
9hf_config:
10 name: SmolLM2-360M
11 org: HuggingFaceTB
12intermediate_size: 2560
13lm_head_bias: false
14mlp_class_name: LLaMAMLP
15n_embd: 960
16n_expert: 0
17n_expert_per_token: 0
18n_head: 15
19n_layer: 32
20n_query_groups: 5
21name: SmolLM2-360M
22norm_class_name: RMSNorm
23norm_eps: 1.0e-05
24norm_qk: false
25padded_vocab_size: 49152
26padding_multiple: 512
27parallel_residual: false
28post_attention_norm: false
29post_mlp_norm: false
30rope_adjustments: null
31rope_base: 100000
32rope_condense_ratio: 1
33rotary_percentage: 1.0
34scale_embeddings: false
35shared_attention_norm: false
36sliding_window_layer_placing: null
37sliding_window_size: null
38vocab_size: 49152
39
This repository hosts multiple revisions of the model.
To load a specific revision, use the revision parameter. For example:
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained("locuslab/base-smollm2-360m-all_raw_folders_baseline-300B-mbs16-gbs1024-16feb", revision="final")
4tokenizer = AutoTokenizer.from_pretrained("locuslab/base-smollm2-360m-all_raw_folders_baseline-300B-mbs16-gbs1024-16feb", revision="final")