Appendix 3: 動的剪定の幾何学: 柔軟な回路がもたらす知能(理解度チェック)
選択的な計算
Q1. 静的と動的な回路
静的な回路と動的な回路の違いとして、正しいものはどれか。
本文の対応箇所: 参照する
Q2. Attentionの剪定
Attentionをミクロな動的剪定と見る理由はどれか。
本文の対応箇所: 参照する
Q3. MoE(Mixture of Experts、専門家混合)のルーティング
MoE(Mixture of Experts、専門家混合)をマクロな部分空間スイッチングと見る説明はどれか。
本文の対応箇所: 参照する
Q4. Routing Collapse
Routing Collapseが起きると、何が問題になるか。
本文の対応箇所: 参照する
疎性と効率化
Q5. スパース化の条件
スパース化が有効になる条件として、最も適切なものはどれか。
本文の対応箇所: 参照する
Q6. GQA(Grouped-Query Attention)、LoRA(Low-Rank Adaptation)、MoD(Mixture-of-Depths)
GQA(Grouped-Query Attention)、LoRA(Low-Rank Adaptation)、MoD(Mixture-of-Depths)に共通する設計思想はどれか。
本文の対応箇所: 参照する
Q7. FlashAttention(メモリ入出力を削減するAttention実装)
FlashAttention(メモリ入出力を削減するAttention実装)の主な工夫はどれか。
本文の対応箇所: 参照する
Q8. 動的剪定と知能
動的剪定で平均レイテンシは下がったが、長い入力の一部で品質が落ちた。次の評価として、最も適切なものはどれか。
本文の対応箇所: 参照する