| 項目 | 値 |
|---|---|
| パラメータ数 | 35,658,240 |
| 非埋め込みパラメータ | 19,274,240 |
| 語彙 | 32,000 (SentencePiece unigram / byte fallback) |
| 文脈長 | 512 |
| 層 / 次元 / ヘッド | 6 / 512 / 8 |
| 構成 | RoPE / RMSNorm / SwiGLU / bias なし / weight tying |
| 事前学習トークン | 367,607,808 |
| 事前学習コーパス | 1,199,015,862 文字 |
| 学習環境 | Apple M1 Max 64GB / MLX |
| 指標 | 3LM-MLX | 前作 (2LM-MLX) | 差 |
|---|---|---|---|
| bits/char (低いほど良い) | 2.801 | 2.540 | +0.261 (悪化) |
| 反復率 (低いほど良い) | 0.300 | 0.100 | +0.200 (悪化) |
| 主題保持率 (高いほど良い) | 0.667 | 0.733 | -0.066 (悪化) |
| 破綻率 (低いほど良い) | 0.000 | 0.000 | +0.000 (変化なし) |
holdout_clean.txt (220 行)。学習データから除いたうえで、部分一致でも混入していないことを検査してから測っています。| モデル | A 公開データ由来の会話 | B Web文+青空文庫 |
|---|---|---|
| 2LM 13.81M | 2.540 | 6.481 |
| 3LM 35.66M 事前学習のみ | 3.381 | 3.680 |
| 3LM 35.66M SFT済み | 2.801 | 4.651 |
| 3LM 35.66M 口調あり | 3.154 | 4.901 |
pip install mlx numpy sentencepiece1from huggingface_hub import snapshot_download
2from src.generate import load_bundle, chat_stream
3
4path = snapshot_download("GeneLab/3LM-MLX")
5model, tokenizer = load_bundle(path)
6for piece in chat_stream(model, tokenizer, [], "日本の首都はどこですか"):
7 print(piece, end="", flush=True)<|assistant|> より後ろと <|end|> だけに掛けています (instruction masking)| データ | ライセンス | 使った量 |
|---|---|---|
HuggingFaceFW/fineweb-2 (jpn_Jpan) | ODC-By 1.0 | 1,080,000,054 文字 (90.1%) |
| globis-university/aozorabunko-clean | CC BY 4.0 | 119,015,882 文字 (9.9%) |
af9c13333eb9 / 青空文庫 42a9c9c0f1d6)。コーパス本体は再ホストせず、スクリプトと manifest で再現できる形にしています。| データ | ライセンス |
|---|---|
| kunishou/oasst1-89k-ja | Apache-2.0 |
| llm-jp/oasst2-33k-ja | Apache-2.0 |
| llm-jp/magpie-sft-v1.0 | Apache-2.0 |
| Aratako/Magpie-Tanuki-8B-97k | Apache-2.0 |