AI—26 · TOÁN & MÔ HÌNH

Đặt bốn optimizer
chạy cùng một chỗ.

Cho SGD, Momentum, RMSProp và Adam xuất phát cùng điểm trên một mặt loss, rồi chỉnh learning rate để so sánh đường đi của chúng.

MẶT LOSS · MÀU SÁNG = LOSS THẤP

Thung lũng dài · xuất phát (2, 1.5)

Trục y dốc gấp 10 lần trục x. SGD với LR to sẽ nảy qua lại theo y; LR nhỏ thì bò mãi theo x. RMSProp/Adam chia gradient cho độ lớn lịch sử nên đi đều cả hai trục.

Learning rate (chung cả bốn)0.1

Đổi LR hoặc mặt loss là cả bốn xếp hàng chạy lại từ đầu. Thử LR 0.3 trên thung lũng dài — SGD nảy như bóng bàn.

0Bước đã chạy / 300
loss < 0.01Điều kiện về đích
0/4Đã về đích
0.1Learning rate
BẢNG ĐUA · CẬP NHẬT THEO BƯỚC
OptimizerVị trí (x, y)LossVề đích ở bước
SGDθ ← θ − lr·g2.000, 1.50013.250
Momentum 0.9v ← 0.9v + g2.000, 1.50013.250
RMSPropchia g cho √(trung bình g²)2.000, 1.50013.250
Adammomentum + RMSProp + bias-correction2.000, 1.50013.250

Công thức chạy đúng chuẩn: Momentum β=0.9; RMSProp ρ=0.99, ε=1e-8; Adam β₁=0.9, β₂=0.999 kèm bias-correction. Không có nhiễu — mọi quỹ đạo tái lập được từng bước.

Mọi phép tính đều ở trong tab này.

Không có dữ liệu nào được gửi lên server.