transformers
201d5624
- Compute MoE load-balancing loss per layer to avoid giant one-hot materialization
Go
Login via GitHub
Home
Pricing
FAQ
Install
Login
via GitHub
Commit
View On
GitHub
Commit
3 days ago
Compute MoE load-balancing loss per layer to avoid giant one-hot materialization
References
fix-moe-aux-loss-memory
#48131 - Compute MoE load-balancing loss per layer to avoid giant one-hot materialization −99.7% @ 128k
Author
qgallouedec
Committer
qgallouedec
Parents
94f09cfe
Loading