Definíció
A gradiens módszer (gradient descent) iteratív optimalizálási algoritmus, amely a költségfüggvény gradiensének ellentétes irányában frissíti a paramétereket: w := w - α∇J(w).
Variációk
Batch GD: teljes adathalmaz gradiense. SGD: egy véletlen minta. Mini-batch: kis batch méret (32, 64, 128) — gyakorlatban leggyakoribb.
Learning rate
A learning rate (α) kritikus hiperparaméter. Túl nagy: instabilitás; túl kicsi: lassú konvergencia. Learning rate scheduling és warmup technikák segítenek.
Momentum és adaptív módszerek
Momentum felgyorsítja a konvergenciát: v := βv + ∇J, w := w - αv. Adam kombinál momentumot és adaptív learning rate-et.
Elemzési megjegyzések
A gradiens módszer lokális minimumokba ragadhat nemkonvex függvényeken. Inicializálás és regularizáció befolyásolja a végeredményt.