Views
No views yet
pip install git+https://github.com/evilsocket/alucard.git1from alucard import Alucard
2
3# Load model (downloads weights automatically from HuggingFace)
4model = Alucard.from_pretrained("evilsocket/alucard")
5
6# Generate a sprite
7sprite = model("a pixel art knight sprite, idle pose")
8sprite.save("knight.png")
9
10# Generate multiple variations
11sprites = model("a pixel art dragon enemy sprite", num_samples=4, seed=42)
12for i, s in enumerate(sprites):
13 s.save(f"dragon_{i}.png")ref parameter to condition generation on a previous frame:1from alucard import Alucard
2
3model = Alucard.from_pretrained("evilsocket/alucard")
4
5# Generate the first frame
6frame_1 = model("a pixel art knight sprite, walking right, frame 1")
7frame_1.save("walk_01.png")
8
9# Generate subsequent frames by passing the previous frame as reference
10frame_2 = model("a pixel art knight sprite, walking right, frame 2", ref=frame_1)
11frame_2.save("walk_02.png")
12
13frame_3 = model("a pixel art knight sprite, walking right, frame 3", ref=frame_2)
14frame_3.save("walk_03.png")
15
16frame_4 = model("a pixel art knight sprite, walking right, frame 4", ref=frame_3)
17frame_4.save("walk_04.png")ref:sprite = model("a pixel art knight sprite, attack pose", ref="walk_01.png")1sprite = model(
2 "a pixel art wizard sprite",
3 num_samples=1, # number of images to generate
4 num_steps=20, # Euler ODE steps (more = better quality, slower)
5 cfg_text=5.0, # text guidance scale (higher = stronger prompt adherence)
6 cfg_ref=2.0, # reference guidance scale (higher = more similar to ref)
7 seed=42, # reproducibility
8)1# From a .safetensors file
2model = Alucard.from_pretrained("path/to/alucard_model.safetensors")
3
4# From a training checkpoint
5model = Alucard.from_pretrained("path/to/best.pt")
6
7# From a local directory containing alucard_model.safetensors
8model = Alucard.from_pretrained("path/to/model_dir/")| Property | Value |
|---|---|
| Parameters | 31,956,228 (32M) |
| Input | 128x128 RGBA (4ch noisy + 4ch reference) |
| Output | 128x128 RGBA |
| Text encoder | CLIP ViT-B/32 (frozen, 512-dim) |
| Conditioning | AdaLN-Zero |
| Training | Flow matching (rectified flow) |
| Base channels | 64, multipliers [1, 2, 4, 4] |
| Attention | Self-attention at 32x32 and 16x16 |
evilsocket@gmail.com for inquiries.