Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "Brain2nd/NeuronSpark-V3-1.1B-Pretrain",
5 trust_remote_code=True,
6)
7tokenizer = AutoTokenizer.from_pretrained(
8 "Brain2nd/NeuronSpark-V3-1.1B-Pretrain"
9)deepspeed/ directory contains 8-rank ZeRO-2 sharded optimizer state.
Use with DeepSpeed launcher to continue training from this exact point:1git lfs install
2git clone https://huggingface.co/Brain2nd/NeuronSpark-V3-1.1B-Pretrain ./ckpt
3deepspeed --num_gpus=8 train_pretrain.py \
4 --deepspeed_config ds_config.json \
5 --resume ./ckptmodel.safetensors | HF-format bf16 weights |
config.json / generation_config.json | model config |
tokenizer.json / tokenizer_config.json | tokenizer |
modeling_neuronspark.py / configuration_neuronspark.py / __init__.py | custom architecture (trust_remote_code=True) |
deepspeed/ | ZeRO-2 optimizer state (8 ranks, fp32 master + Adam moments) |
training_state.pth | step / tokens_seen / epoch metadata |
zero_to_fp32.py | DeepSpeed helper to consolidate sharded state |