Two-parameter Weibull lens on transformer weights (shape k, scale λ): 7-family benchmark, AdamW training dynamics (three-force λ evolution), a data-predictability law for λ growth, and a 76-run grid showing weight-scale growth tracks training effort, not learning quality. npm-weibull-py + database + code, arXiv:2605.18898/2606.19367/2608.23573
machine-learning deep-learning transformers neural-networks arxiv interpretability weibull-distribution adamw-optimizer training-dynamics model-diagnostics large-language-models llm weight-analysis
-
Updated
Aug 26, 2026 - Python