Views
No views yet
| Parameter | Value |
|---|---|
| Base model | Qwen/Qwen3-1.7B |
| Base vocab size | 151,669 |
| Tokens injected | 5226 |
| Final vocab size | 156,928 |
| Embedding init strategy | Mean-of-subpieces |
PDSCH, gNB, mmWave, eMBB, HARQ are split into multiple BPE subpieces by the base tokenizer, wasting context window and making it harder for the model to learn domain concepts. After injection, each term is a single atomic token.1from transformers import AutoTokenizer, AutoModelForCausalLM
2
3tokenizer = AutoTokenizer.from_pretrained("vimalgupta/qwen-telecom-injected_v3")
4model = AutoModelForCausalLM.from_pretrained("vimalgupta/qwen-telecom-injected_v3")
5
6# Verify injection
7tokens = tokenizer.encode("PDSCH HARQ gNB mmWave", add_special_tokens=False)
8print(tokenizer.convert_ids_to_tokens(tokens))
9# Each term should be a single token