Views
No views yet
Bochkov/emergent-semantics-model-uni-glyph-335m under identical architecture, tokenizer, and training regime.d_model): 1024nn.Embedding)Bochkov/bvv241-2-31
2import torch
3from transformers import AutoTokenizer, AutoModelForCausalLM
4
5tokenizer = AutoTokenizer.from_pretrained("Bochkov/emergent-semantics-model-unfrozen-335m")
6model = AutoModelForCausalLM.from_pretrained("Bochkov/emergent-semantics-model-unfrozen-335m", trust_remote_code=True).to('cuda')
7
8inputs = torch.tensor([tokenizer.encode("Question: What is the capital of Japan?\nAnswer:")], dtype=torch.long, device='cuda')
9
10outputs = model.generate(
11 inputs,
12 max_new_tokens=10,
13 do_sample=False
14)
15print(tokenizer.decode(outputs[0].tolist()))
16
17#Question: What is the capital of Japan?
18#Answer:Tokyo Metropolitan
19@article{
bochkov2025emergent,
title={Emergent Semantics Beyond Token Embeddings: Transformer {LM}s with Frozen Visual Unicode Representations},
author={Andrey Bochkov},
journal={Transactions on Machine Learning Research},
issn={2835-8856},
year={2025},
url={https://openreview.net/forum?id=Odh8IynO1o},
note={}
}
@misc{bochkov2025growingtransformersmodularcomposition,
title={Growing Transformers: Modular Composition and Layer-wise Expansion on a Frozen Substrate},
author={A. Bochkov},
year={2025},
eprint={2507.07129},
archivePrefix={arXiv},
primaryClass={cs.LG},
url={https://arxiv.org/abs/2507.07129},
}