Dieses Modell basiert auf der originalen GPT-2 Architektur von OpenAI, wurde jedoch strukturell erweitert:
Die zusätzlichen Layer wurden aus dem originalen GPT-2 dupliziert und anschließend durch ein Heilungs-Training auf deutscher Wikipedia stabilisiert, sodass alle Layer kohärent zusammenarbeiten.
1from transformers import GPT2LMHeadModel, GPT2TokenizerFast
2
3model = GPT2LMHeadModel.from_pretrained("Atomic-Ai/GPT2-24Layers")
4tokenizer = GPT2TokenizerFast.from_pretrained("Atomic-Ai/GPT2-24Layers")
5
6input_text = "Die Geschichte Deutschlands"
7input_ids = tokenizer.encode(input_text, return_tensors="pt")
8
9output = model.generate(
10 input_ids,
11 max_length=200,
12 temperature=0.8,
13 top_p=0.9,
14 top_k=50,
15 do_sample=True,
16 no_repeat_ngram_size=3,
17)
18
19print(tokenizer.decode(output[0], skip_special_tokens=True))
1@misc{atomic-ai-gpt2-24layers,
2 title={GPT2-24Layers: An Expanded German GPT-2 Model},
3 author={Atomic AI Studios},
4 year={2026},
5 url={https://huggingface.co/Atomic-Ai/GPT2-24Layers}
6}