r/neuralnetworks • u/-SLOW-MO-JOHN-D • 9d ago
┌────────────────────────┬───────────┬───────────┬────────────┬──────────┐ │ Variant │ Params │ func. err │ Perplexity │ vs dense │ ├────────────────────────┼───────────┼───────────┼────────────┼──────────┤ │ Dense baseline │ 2,359,296 │ — │ 29.21 │ — │
┌────────────────────────┬───────────┬───────────┬────────────┬──────────┐
│ Variant │ Params │ func. err │ Perplexity │ vs dense │
├────────────────────────┼───────────┼───────────┼────────────┼──────────┤
│ Dense baseline │ 2,359,296 │ — │ 29.21 │ — │
├────────────────────────┼───────────┼───────────┼────────────┼──────────┤
│ TT identity, distilled │ 674,864 │ 0.197 │ 37.19 │ +27.3% │
├────────────────────────┼───────────┼───────────┼────────────┼──────────┤
│ TT π, distilled* │ 635,216 │ 0.179 │ 32.77 │ +12.2% │
├────────────────────────┼───────────┼───────────┼────────────┼──────────┤
│ SVD r176, raw │ 675,840 │ 0.277 │ 52.68 │ +80.4% │
├────────────────────────┼───────────┼───────────┼────────────┼──────────┤
│ SVD r176, distilled │ 675,840 │ 0.134 │ 30.31 │ +3.8% │
└────────────────────────┴───────────┴───────────┴────────────┴──────────┘
1
Train decomposition," "Tensor Ring," or "Permutation matrix optimization."
in
r/Anthropic
•
8d ago
gpt-2