Description
Vanilla SGD (原始随机梯度下降法) 虽然Converge in Expectation,但通常产生大的SGN (随机梯度噪音) 使得单条路径往往无法Converge in High-Probability,于是科学家们通过非线性SGD来减少过于大的噪音。Component-wise Quantization (分量量化法) 在是近期表现最没毛病的非线性SGD,并且它似乎并不符合人们对于常规没毛病的非线性SGD的假设,尤其是 {Odd Function} 及其 {近似0极小值转换后不等于0} 的猜想。于是我在思考后认为 {Odd} → {Odd a.e.} 是更合理, {近似0极小值转换后不等于0} 可以保留。非线性函数过0区间们 {(q_k, q_{k+1}], (q_{k+1}, q_{k+2}], (q_{k+2}, q_{k+3}]} 可以写为 {(q_k, \lim_{n \to \infty} -\frac{1}{n}], (\lim_{n \to \infty} -\frac{1}{n}, 0], (0, q_{k+3}]}。
【注: Inference: https://arxiv.org/pdf/2310.18784】