Views
No views yet
evaluation/evaluate.py.pt, safetensors y gguf con export/export.py.model.use_flash_attention: true en tu archivo YAML de configuración.xformers; en CPU o si xformers no está disponible, la atención causal de PyTorch se usa como respaldo.use_flash_attention: false.pip install -r requirements.txtpython datasets/download_dataset.py --output datasets/tiny.txtpython tokenizer/train_tokenizer.py --input datasets/tiny.txt --model-prefix artifacts/tokenizer/marslm --vocab-size 32000python datasets/preprocess.py --input datasets/tiny.txt --tokenizer artifacts/tokenizer/marslm.json --output artifacts/data/tokens.pt --block-size 512python training/train.py --config configs/marslm-100M.yaml --train-file artifacts/data/tokens.pt --tokenizer-model artifacts/tokenizer/marslm.json --output-dir artifacts/checkpoints --epochs 3 --batch-size 1 --gradient-accumulation-steps 4 --warmup-steps 50python inference/generate.py --model-path artifacts/checkpoints/marslm-final.pt --config artifacts/checkpoints/config.json --tokenizer-model artifacts/tokenizer/marslm.jsonpython quantization/export_gguf.py --model-path artifacts/checkpoints/marslm-final.pt --output artifacts/quantized/model --quant-type int8docs/TerminalGuide.md tiene los pasos y los scripts.configs/marslm-5B.yaml como referencia para una arquitectura de ~5B parámetros.configs/marslm-10B.yaml como referencia para una arquitectura de ~10B parámetros.datasets/wikipedia/ o en cualquier carpeta nueva.python datasets/download_dataset.py --output datasets/wikipedia/raw.txt --url https://...python tokenizer/train_tokenizer.py --input datasets/wikipedia/*.txt --model-prefix artifacts/tokenizer/marslm --vocab-size 32000python datasets/preprocess.py --input datasets/wikipedia/*.txt --tokenizer artifacts/tokenizer/marslm.json --output artifacts/data/tokens.pt --block-size 512python training/train.py --config configs/marslm-5B.yaml --train-file artifacts/data/tokens.pt --tokenizer-model artifacts/tokenizer/marslm.json --output-dir artifacts/checkpoints