Paper · Source code · Jittor
This is a Jittor implementation of the paper: 《Massive Activations in Large Language Models》[COLM 2024]
If you have any questions about this repository, please leave a comment in the Issues section.🥰🥰🥰
Massive/
├── data/
│ ├── corpus/ # corpus for LLM
│ ├── image/ # image for ViT
│ ├── models/ # Hugging Face model checkpoints
│ └── source/ # Figure from paper
│
├── jittor/
│ ├── jittor_llama/ # LLaMA implementation (Jittor)
│ └── jittor_gpt2/ # GPT2 implementation (Jittor)
│
├── pytorch/
│ ├── gpt-2/ # GPT-2 related implementation
│ ├── lib/ # shared libraries
│ ├── monkey_patch/ # tool
│ ├── main_llm.py # entry for LLM experiments
│ └── main_vit.py # entry for ViT experiments
│
├── results/ # Experiment log and results
│
├── README.md
└── requirements.txt
Note
Massive/jittor 内没有任何pytorch函数,就像Massive/pytorch 内没有任何jittor函数
- 🧾 源论文实验结果
- 🔍 本人实验结果
由于论文未阐明指定激活值的检测层,故本人选用LLAMA-7b的第1、10、20、31层作为指定层。 按照原论文结论,初始层和结尾层激活值相比于中间层更低(参考原论文Figure 4及表述),本人对以上四层的实验结果也验证了该原文表述,即下图中起始层Layer-1,结尾层Layer-31相比中间层Layer-10,Layer-20的超级 激活值更少。
- ✒️ 本人实验日志
- 🧾 源论文实验结果
- 🔍 本人实验结果
下图仅展示LLAMA-7b、LLAMA-13b结果,其余LLM实现思路一致。 各模型展示三个种子(42、2026、10096)下的实验结果,保证普遍性。
- ✒️ 本人实验日志
- 🧾 源论文实验结果
- 🔍 本人实验结果
展示结果的参数网格:{seed:42,2026; layer_id:2,20} 呃,种子的选择基本没有影响,因为本身仅推理过程...- 📈 LLAMA2-7b Seed=42 Layer_id=2
Intervention WikiText C4 PG-19 Original 5.116 7.620 8.077 Set to zero inf inf inf Set to mean 5.120 7.624 8.091 - 📈 LLAMA2-7b Seed=42 Layer_id=20
Intervention WikiText C4 PG-19 Original 5.120 7.619 8.077 Set to zero inf inf inf Set to mean 5.120 7.624 8.089 - 📈 LLAMA2-7b Seed=2026 Layer_id=2
Intervention WikiText C4 PG-19 Original 5.116 7.619 8.077 Set to zero inf inf inf Set to mean 5.120 7.624 8.091 - 📈 LLAMA2-7b Seed=2026 Layer_id=20
Intervention WikiText C4 PG-19 Original 5.116 7.619 8.077 Set to zero inf inf inf Set to mean 5.120 7.624 8.089
- 📈 LLAMA2-13b Seed=42 Layer_id=2
Intervention WikiText C4 PG-19 Original 4.573 7.043 7.0149 Set to zero 655.524 699.837 589.110 Set to mean 238.952 200.041 187.394 - 📈 LLAMA2-13b Seed=42 Layer_id=20
Intervention WikiText C4 PG-19 Original 4.573 7.043 7.015 Set to zero 284.995 258.798 204.537 Set to mean 4.578 7.049 7.021 - 📈 LLAMA2-13b Seed=2026 Layer_id=2
Intervention WikiText C4 PG-19 Original 4.573 7.043 7.014 Set to zero 655.528 699.819 589.093 Set to mean 238.958 200.048 187.398 - 📈 LLAMA2-13b Seed=2026 Layer_id=20
Intervention WikiText C4 PG-19 Original 4.573 7.043 7.014 Set to zero 285.029 258.801 204.546 Set to mean 4.578 7.049 7.021
- 📈 LLAMA2-7b Seed=42 Layer_id=2
- ✒️ 本人实验日志
- 🧾 源论文实验结果
- 🔍 本人实验结果
下图仅展示LLAMA-7b、LLAMA-13b结果,其余LLM实现思路一致。 各模型展示三个种子(42、2026)下的实验结果,层选择与原文一致。
- ✒️ 本人实验日志
- 🧾 源论文实验结果
- 🔍 本人实验结果
下图仅展示LLAMA-7b、LLAMA-13b结果,其余LLM实现思路一致。 实验参数网格:{seed: 42, 2026; layer_id: 2, 15} 该实验结果也可以看出,起始层和结尾层的超级激活值特征不明显;下图只标出中间层的超级激活之;-
📈 Table1 seed=42 layer_id=2
Model Top 1 Top 2 Top 3 Top 4 Top 5 Top-10 Top-100 Top 1% Top 10% median LLaMA2-7B 2483.4600 1464.2400 769.9925 461.7525 160.8406 54.4975 3.8934 0.1077 0.0535 0.0188 LLaMA2-13B 91.8762 80.0900 40.9753 34.9484 31.4344 7.0844 1.8285 0.1203 0.0608 0.0212 -
📉 Table2 seed=42 layer_id=2
Model Top 1 Top 2 Top 1% Top 10% Median LLaMA2-7B 2483.4600 ± 201.6950 -1464.2400 ± 118.3621 -0.0131 ± 0.1075 0.0021 ± 0.0538 -0.0008 ± 0.0189 LLaMA2-13B -91.8762 ± 5.3607 -80.0900 ± 12.7943 -0.0025 ± 0.1209 -0.0049 ± 0.0609 0.0023 ± 0.0212 -
📈 Table1 seed=42 layer_id=15
Model Top 1 Top 2 Top 3 Top 4 Top 5 Top-10 Top-100 Top 1% Top 10% median LLaMA2-7B 2497.5700 1472.3900 782.7950 468.3200 154.7988 46.8253 9.9369 0.9760 0.5701 0.2266 LLaMA2-13B 1271.2700 787.0900 70.1469 64.9359 53.2294 40.5575 11.7909 1.0746 0.6311 0.2511 -
📉 Table2 seed=42 layer_id=15
Model Top 1 Top 2 Top 1% Top 10% Median LLaMA2-7B 2497.5700 ± 201.8074 -1472.3900 ± 118.5022 0.0571 ± 0.9794 0.0459 ± 0.571 -0.0009 ± 0.2278 LLaMA2-13B -1271.2700 ± 12.3049 -787.0900 ± 44.7056 -0.1714 ± 1.0663 0.0274 ± 0.6338 -0.0097 ± 0.2522 -
📈 Table1 seed=2026 layer_id=2
Model Top 1 Top 2 Top 3 Top 4 Top 5 Top-10 Top-100 Top 1% Top 10% median LLaMA2-7B 2529.5000 1491.1800 769.8650 459.7175 159.7562 52.9612 3.9493 0.1078 0.0535 0.0188 LLaMA2-13B 92.2856 79.5378 41.0412 35.2935 31.1086 7.1793 1.8688 0.1207 0.0609 0.0212 -
📉 Table2 seed=2026 layer_id=2
Model Top 1 Top 2 Top 1% Top 10% Median LLaMA2-7B 2529.5000 ± 190.8036 -1491.1800 ± 111.8119 0.0062 ± 0.1082 0.0032 ± 0.0537 -0.0004 ± 0.0189 LLaMA2-13B 92.2856 ± 3.5321 -79.5378 ± 11.9228 -0.0105 ± 0.1208 0.0072 ± 0.0608 -0.0049 ± 0.0207 -
📈 Table1 seed=2026 layer_id=15
Model Top 1 Top 2 Top 3 Top 4 Top 5 Top-10 Top-100 Top 1% Top 10% median LLaMA2-7B 2543.7400 1499.3700 782.6300 466.2175 154.0350 44.9828 9.8195 0.9751 0.5694 0.2262 LLaMA2-13B 1270.3000 781.8750 58.4928 53.0266 41.4734 33.2675 11.6262 1.0717 0.6295 0.2504 -
📉 Table2 seed=2026 layer_id=15
Model Top 1 Top 2 Top 1% Top 10% Median LLaMA2-7B 2543.7400 ± 190.9264 -1499.3700 ± 111.9376 0.1537 ± 0.9680 -0.0349 ± 0.5714 -0.0182 ± 0.2267 LLaMA2-13B -1270.3000 ± 13.3132 -781.8750 ± 7.7075 -0.0203 ± 1.0770 0.0507 ± 0.6308 -0.0445 ± 0.2477
-
- ✒️ 本人实验日志
✨ Exp6:Activation trajectory starting from input hidden states to query, key and value states.
- 🧾 源论文实验结果
- 🔍 本人实验结果
LLAMA2-7b 模型 实验参数网格:{seed: 42, 2026; layer_id: 3, 15}- 📈 LLAMA2-7b Result seed=42 layer_id=3






- 📈 LLAMA2-7b Result seed=42 layer_id=15






- 📈 LLAMA2-7b Result seed=2026 layer_id=3






- 📈 LLAMA2-7b Result seed=2026 layer_id=15






- 📈 LLAMA2-7b Result seed=42 layer_id=3
- ✒️ 本人实验日志
- 🧾 源论文实验结果
- 🔍 本人实验结果
模型: GPT-2,基于nano GPT. 实验参数网格:{layer_id: 5, 8; sample_seq: "Summer is warm. Winter is cold.", "I love computer science and computer vision."}
- ✒️ 本人实验日志



































































































