Views
No views yet
fineweb-edu dataset. The model is 344M parameters.| Size | Training Tokens | Layers | Model Dimension | Self-Attention Heads | Relational Attention Heads | Relation Dimension | Context Length |
|---|---|---|---|---|---|---|---|
| 344M | 10B | 24 | 1024 | 8 | 8 | 64 | 1024 |
dual-attention python package hosted on PyPI via pip install dual-attention.from dual_attention.hf import DualAttnTransformerLM_HFHub
DualAttnTransformerLM_HFHub.from_pretrained('awni00/DAT-sa8-ra8-nr64-ns1024-sh8-nkvh4-343M')@misc{altabaa2024disentanglingintegratingrelationalsensory,
title={Disentangling and Integrating Relational and Sensory Information in Transformer Architectures},
author={Awni Altabaa and John Lafferty},
year={2024},
eprint={2405.16727},
archivePrefix={arXiv},
primaryClass={cs.LG},
url={https://arxiv.org/abs/2405.16727},
}