GoGPT:ICT中英文底座增强大模型,基于Llama/Llama 2训练的底座大模型,参数规模包括70亿参数、130亿参数

| 模型名称 | 基座模型 | 模型大小 | 下载地址 |
|---|---|---|---|
| golaxy/gogpt-7b | Llama-7b | 7B | 模型下载 |
| golaxy/gogpt2-7b | Llama2-7b | 7B | 模型下载 |
1├── data
2│ └── corpus.txt 训练语料
3├── llama
4│ ├── tokenizer_checklist.chk
5│ └── tokenizer.model
6├── merged_tokenizer_hf 合并结果 hf格式
7│ ├── special_tokens_map.json
8│ ├── tokenizer_config.json
9│ └── tokenizer.model
10├── merged_tokenizer_sp
11│ └── open_llama.model #
12├── merge_tokenizer
13│ └── tokenizer.model
14├── open_llama.model 训练的sp模型
15├── open_llama.vocab 训练的sp词汇表
16├── README.md
17├── step0_step0_process_text.py 基于多分数据集准备训练语料
18├── step1_make_corpus.py 基于中文Wikipedia数据准备训练语料
19├── step2_train_tokenzier.py 训练分词器
20├── step3_tokenzier_segment.py 测试训练后的模型,包括编码和解码测试样例
21└── step4_merge_tokenizers.py 与原版llama的分词器进行合并,得到hf格式的tokenizer
22在中文预训练语料上对LLaMA进行增量预训练、继续预训练
TODO