Views
No views yet
AIhomeJP/home1.1 は、1つのTransformerブロックを12回再帰させることで、15.4Mという極小パラメーター数ながら高い計算効率を目指した実験的モデルです。trust_remote_code=True が必須です。また、現在の実装では attention_mask を forward で受け取らないため、推論時にはこれを除去する必要があります。1import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4model_id = "AIhomeJP/home1.1-base"
5tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
6model = AutoModelForCausalLM.from_pretrained(model_id, trust_remote_code=True)
7
8# 互換性のための注入
9model.config.num_hidden_layers = 1
10model.to("cuda" if torch.cuda.is_available() else "cpu")
11
12prompt = "<|user|>hello!<|end|><|assistant|>"
13inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
14
15# 重要: attention_maskを除去し、use_cache=Falseを指定
16if "attention_mask" in inputs: del inputs["attention_mask"]
17
18outputs = model.generate(**inputs, max_new_tokens=100, use_cache=False)
19print(tokenizer.decode(outputs[0], skip_special_tokens=True))