2121-8/TinySlime-1.1B-v1.0 は、TinyLlama/TinyLlama-1.1B-intermediate-step-1431k-3T をベースモデルとし、augmxnt/shisa-pretrain-en-ja-v1 の学習データを使用してトレーニングされたモデルです。本モデルは、5.5B のトークンで学習されました。
このモデルは、スマートフォン、NVIDIA Jetson などの組み込みで動かすことを想定し作成されました。
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model_name = "2121-8/TinyLlama-v1.0"
4tokenizer = AutoTokenizer.from_pretrained(model_name)
5model = AutoModel.from_pretrained(model_name)
1input_text = "西郷隆盛は明治時代の"
2input_ids = tokenizer.encode(input_text, return_tensors='pt')
3
4# テキストを生成
5outputs = model.generate(input_ids, max_length=50, num_return_sequences=1)
6generated_text = tokenizer.decode(outputs[0], skip_special_tokens=True)
7
8print(generated_text)
このモデルは、TinyLlama プロジェクトの成果に基づいて構築され、
augmxnt/shisa-pretrain-en-ja-v1データセットを使用して学習されました。
また、このモデルの開発にあたり、
Axolotl のサポートとツールを利用しました。
NLP コミュニティへの貢献に感謝します。