Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
Original file line number Diff line number Diff line change
@@ -0,0 +1,145 @@
protocol:
name: nanogpt_four_head_2026_08_27_ww_baseline
version: 1
description: Four-corpus-equivalent-epoch AdamW and MuonClip baselines with five paired seeds, four attention heads, and WeightWatcher raw and clip_xmax monitoring.

dataset:
name: HuggingFaceFW/fineweb-edu
config: sample-10BT
split: train
revision: 593b3a867298afb8ce42625a270ef20ddcad28f9
tokenizer: gpt2
train_tokens: 80000000
val_tokens: 1000000
test_tokens: 1000000

model:
vocab_size: 50257
block_size: 256
n_layer: 1
n_head: 4
n_embd: 128
dropout: 0.0
bias: false
tie_weights: true

training:
seeds: [1337, 2027, 4099, 31415, 271828]
batch_size: 4
grad_accum_steps: 8
target_epochs: 4.0
epoch_interval: 0.25
eval_interval_steps: 500
eval_batches: 64
checkpoint_interval_steps: 500
grad_clip: 1.0

optimizer_profiles:
sgd_momentum:
display_name: SGD + Nesterov momentum (not a campaign arm)
family: sgd
learning_rate: 0.05
min_learning_rate: 0.005
warmup_fraction: 0.10
lr_schedule_epochs: 1.0
schedule: warmup_cosine
momentum: 0.90
dampening: 0.0
nesterov: true
weight_decay: 0.01

adamw:
display_name: AdamW
family: adamw
learning_rate: 0.0006
min_learning_rate: 0.00006
warmup_fraction: 0.01
lr_schedule_epochs: 1.0
schedule: warmup_cosine
beta1: 0.90
beta2: 0.95
epsilon: 1.0e-8
weight_decay: 0.10

adam:
display_name: Adam (not a campaign arm)
family: adam
learning_rate: 0.0006
min_learning_rate: 0.00006
warmup_fraction: 0.01
lr_schedule_epochs: 1.0
schedule: warmup_cosine
beta1: 0.90
beta2: 0.95
epsilon: 1.0e-8
weight_decay: 0.0

muon:
display_name: Muon + auxiliary AdamW (not a campaign arm)
family: muon
matrix_learning_rate: 0.02
matrix_min_learning_rate: 0.002
aux_learning_rate: 0.0003
aux_min_learning_rate: 0.00003
warmup_fraction: 0.05
lr_schedule_epochs: 1.0
schedule: warmup_cosine
momentum: 0.95
nesterov: true
newton_schulz_steps: 5
muon_epsilon: 1.0e-7
matrix_weight_decay: 0.01
beta1: 0.90
beta2: 0.95
epsilon: 1.0e-8
aux_weight_decay: 0.01

muon_clip:
display_name: MuonClip + auxiliary AdamW
family: muon_clip
learning_rate: 0.0002
min_learning_rate: 0.00002
warmup_fraction: 0.0512
lr_schedule_epochs: 1.0
schedule: warmup_cosine
momentum: 0.95
nesterov: false
newton_schulz_steps: 5
muon_epsilon: 1.0e-7
weight_decay: 0.10
update_rms_scale: 0.20
qk_clip_threshold: 100.0
qk_clip_balance: 0.50
qk_diagnostics_interval: 500
beta1: 0.90
beta2: 0.95
epsilon: 1.0e-8

evaluation:
train_probe_seed: 21001
validation_probe_seed: 22001
test_probe_seed: 23001
bleu_probe_seed: 24001
bleu_examples: 64
bleu_prompt_tokens: 64
bleu_continuation_tokens: 32
bleu_batch_size: 4

weightwatcher:
enabled: true
ERG: true
randomize: true
strict: true
min_evals: 20
fix_fingers: clip_xmax
max_fingers: 10
require_raw_alpha: true

runtime:
matmul_precision: highest
allow_tf32: false
cudnn_benchmark: false
mps_fallback: true
deterministic_algorithms: true
deterministic_warn_only: false
empty_mps_cache_after_weightwatcher: true
Loading
Loading