Similar Items: Optimization and Generalization of Gradient Descent for Shallow ReLU Networks with Minimal Width
- Optimization and Generalization of Gradient Descent for Shallow ReLU Networks with Minimal Width
- High-Dimensional Analysis of Gradient Flow for Extensive-Width Quadratic Neural Networks
- Minimax Optimal Convergence of Gradient Descent in Logistic Regression via Large and Adaptive Stepsizes
- Optimizing Attention with Mirror Descent: Generalized Max-Margin Token Selection
- Reparameterized Complex-valued Neurons Can Efficiently Learn More than Real-valued Neurons via Gradient Descent
- Computation by infinite descent made explicit