Views
No views yet
| Exit Layer | Perplexity | Speed (tok/s) |
|---|---|---|
| All layers | TBD | TBD |
| Layer 18 | TBD | TBD |
| Layer 12 | TBD | TBD |
| Layer 6 | TBD | TBD |
pip install transformers torch1from transformers import AutoTokenizer, AutoModelForCausalLM
2
3# Load model
4model = AutoModelForCausalLM.from_pretrained("your-username/bitskip-v1-earlyexit")
5tokenizer = AutoTokenizer.from_pretrained("your-username/bitskip-v1-earlyexit")
6
7# Generate text
8inputs = tokenizer("Once upon a time", return_tensors="pt")
9outputs = model.generate(**inputs, max_length=100)
10print(tokenizer.decode(outputs[0]))1# Exit at layer 12 for faster inference
2model.set_exit_layer(12)
3outputs = model.generate(**inputs, max_length=100)
4# 1.5-2x faster with minimal quality loss1for exit_layer in [6, 12, 18, 24]:
2 model.set_exit_layer(exit_layer)
3 outputs = model.generate(**inputs, max_length=100)
4 print(f"Layer {exit_layer}: {tokenizer.decode(outputs[0])}")1@article{bitnet,
2 title={BitNet: Scaling 1-bit Transformers for Large Language Models},
3 author={Wang, Hongyu and Ma, Shuming and Dong, Li and others},
4 journal={arXiv preprint arXiv:2310.11453},
5 year={2023}
6}
7
8@article{layerskip,
9 title={LayerSkip: Enabling Early Exit Inference and Self-Speculative Decoding},
10 author={Elhoushi, Mostafa and Shrivastava, Akshat and Liskovich, Diana and others},
11 journal={arXiv preprint arXiv:2404.16710},
12 year={2024}
13}