Views
No views yet
| Metric | Value |
|---|---|
| MMLU (5-shot) | 27.3 |
| ARC (25-shot) | 41.7 |
| HellaSwag (10-shot) | 71.1 |
| TruthfulQA (0-shot) | 37.9 |
| Avg. | 44.5 |
mamba-gpt-3b-v3 is trained on multiply dataset:transformers library on a machine with GPUs, first make sure you have the transformers, accelerate and torch libraries installed.1pip install transformers==4.29.2
2pip install accelerate==0.19.0
3pip install torch==2.0.01from transformers import AutoTokenizer, AutoModelForCausalLM
2
3tokenizer = AutoTokenizer.from_pretrained("CobraMamba/mamba-gpt-3b-v3")
4model = AutoModelForCausalLM.from_pretrained("CobraMamba/mamba-gpt-3b-v3", trust_remote_code=True, torch_dtype=torch.float16)
5
6input_context = "Your text here"
7input_ids = tokenizer.encode(input_context, return_tensors="pt")
8output = model.generate(input_ids, max_length=128, temperature=0.7)
9output_text = tokenizer.decode(output[0], skip_special_tokens=True)
10print(output_text)
11LlamaForCausalLM(
(model): LlamaModel(
(embed_tokens): Embedding(32000, 4096, padding_idx=0)
(layers): ModuleList(
(0-31): 32 x LlamaDecoderLayer(
(self_attn): LlamaAttention(
(q_proj): Linear(in_features=4096, out_features=4096, bias=False)
(k_proj): Linear(in_features=4096, out_features=4096, bias=False)
(v_proj): Linear(in_features=4096, out_features=4096, bias=False)
(o_proj): Linear(in_features=4096, out_features=4096, bias=False)
(rotary_emb): LlamaRotaryEmbedding()
)
(mlp): LlamaMLP(
(gate_proj): Linear(in_features=4096, out_features=11008, bias=False)
(down_proj): Linear(in_features=11008, out_features=4096, bias=False)
(up_proj): Linear(in_features=4096, out_features=11008, bias=False)
(act_fn): SiLUActivation()
)
(input_layernorm): LlamaRMSNorm()
(post_attention_layernorm): LlamaRMSNorm()
)
)
(norm): LlamaRMSNorm()
)
(lm_head): Linear(in_features=4096, out_features=32000, bias=False)
)1@Misc{mamba-gpt-3b-v3,
2 title = {Mamba-GPT-3b-v3},
3 author = {chiliu},
4 howpublished = {\url{https://huggingface.co/CobraMamba/mamba-gpt-3b-v3}},
5 year = {2023}
6}