Open-weight & owned stack · Training tuning
Residual Learning Transfers LLM Capabilities Smaller Models
An ICLR 2026 paper presents residual-learning knowledge distillation for transferring language-model capabilities into smaller models.
Read the original at mlanthology.orgOpens the publisher's site in a new tab