Views
No views yet
1import torch
2from transformers import AutoTokenizer, AutoModelForCausalLM
3tokenizer = AutoTokenizer.from_pretrained("llm-jp/llm-jp-3-980m")
4model = AutoModelForCausalLM.from_pretrained("llm-jp/llm-jp-3-980m", device_map="auto", torch_dtype=torch.bfloat16)
5text = "自然言語処理とは何か"
6tokenized_input = tokenizer.encode(text, add_special_tokens=False, return_tensors="pt").to(model.device)
7with torch.no_grad():
8 output = model.generate(
9 tokenized_input,
10 max_new_tokens=100,
11 do_sample=True,
12 top_p=0.95,
13 temperature=0.7,
14 repetition_penalty=1.05,
15 )[0]
16print(tokenizer.decode(output))| Params | Layers | Hidden size | Heads | Context length | Embedding parameters | Non-embedding parameters |
|---|---|---|---|---|---|---|
| 150M | 12 | 512 | 8 | 4096 | 101,874,688 | 50,344,448 |
| 440M | 16 | 1024 | 8 | 4096 | 203,749,376 | 243,303,424 |
| 980M | 20 | 1536 | 8 | 4096 | 305,624,064 | 684,258,816 |
| 1.8b | 24 | 2048 | 16 | 4096 | 407,498,752 | 1,459,718,144 |
| 3.7b | 28 | 3072 | 24 | 4096 | 611,248,128 | 3,171,068,928 |
| 7.2b | 32 | 4096 | 32 | 4096 | 814,997,504 | 6,476,271,616 |
| 13b | 40 | 5120 | 40 | 4096 | 1,018,746,880 | 12,688,184,320 |
| 172b | 96 | 12288 | 96 | 4096 | 2,444,992,512 | 169,947,181,056 |
llm-jp-tokenizer v3.0.
Please refer to README.md of llm-jp-tokenizer for details on the vocabulary construction procedure (the pure SentencePiece training does not reproduce our vocabulary).| Language | Dataset | Tokens |
|---|---|---|
| Japanese | Wikipedia | 2.6B |
| Common Crawl | 762.8B | |
| WARP/PDF | 237.3B | |
| WARP/HTML | 2.7B | |
| Kaken | 1.8B | |
| English | Wikipedia | 4.7B |
| Dolma/CC-head | 608.5B | |
| Dolma/C4 | 181.6B | |
| Dolma/Reddit | 83.1B | |
| Dolma/PeS2o | 62.9B | |
| Dolma/Gutenberg | 5.5B | |
| Dolma/Wiki | 3.9B | |
| Code | The Stack | 114.1B |
| Chinese | Wikipedia | 0.8B |
| Korean | Wikipedia | 0.3B |