Views
No views yet
| Task Group | Environment / Setting | Score |
|---|---|---|
| Bandit | General | 1.0 |
| FrozenLake | Static / Slippery | 0.89 / 0.88 |
| Sokoban | Box1 / Box2 | 0.95 / 0.59 |
| Rubiks' Cube | Rotation 1 / 2 / 3 | 1.0 / 1.0 / 0.89 |
| Sudoku | General | 0.98 |
| Average | Overall Multi-task | 0.91 |
Data source: Internal evaluation metrics for the SCOUT sequential RL pipeline.
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model_name = "Harryis/SCOUT_multitask"
4
5tokenizer = AutoTokenizer.from_pretrained(model_name)
6model = AutoModelForCausalLM.from_pretrained(model_name, device_map="auto")
7
8# Example: Prompt the model for a Sudoku move or Sokoban action