Skip to content

ISadBecase/Massive

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

17 Commits
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

Massive Activations 🥳

Paper · Source code · Jittor

1️⃣ Introduction

This is a Jittor implementation of the paper: 《Massive Activations in Large Language Models》[COLM 2024]

If you have any questions about this repository, please leave a comment in the Issues section.🥰🥰🥰

2️⃣ Project Structure

Massive/
├── data/
│   ├── corpus/                # corpus for LLM
│   ├── image/                 # image for ViT
│   ├── models/                # Hugging Face model checkpoints
│   └── source/                # Figure from paper
│
├── jittor/
│   ├── jittor_llama/          # LLaMA implementation (Jittor)
│   └── jittor_gpt2/           # GPT2 implementation (Jittor)
│
├── pytorch/
│   ├── gpt-2/                 # GPT-2 related implementation
│   ├── lib/                   # shared libraries
│   ├── monkey_patch/          # tool
│   ├── main_llm.py            # entry for LLM experiments
│   └── main_vit.py            # entry for ViT experiments
│
├── results/                   # Experiment log and results
│
├── README.md
└── requirements.txt

Note

Massive/jittor 内没有任何pytorch函数,就像Massive/pytorch 内没有任何jittor函数

3️⃣ Experiment

✨ Exp1:Massive activations in LLM.

  • 🧾 源论文实验结果
    • 源图 Figure1 LLAMA-7b 源图 Figure1
    • 源图 Figure2 LLAMA-13b 源图 Figure2
  • 🔍 本人实验结果
    由于论文未阐明指定激活值的检测层,故本人选用LLAMA-7b的第1、10、20、31层作为指定层。
    按照原论文结论,初始层和结尾层激活值相比于中间层更低(参考原论文Figure 4及表述),本人对以上四层的实验结果也验证了该原文表述,即下图中起始层Layer-1,结尾层Layer-31相比中间层Layer-10,Layer-20的超级 激活值更少。
    
    • 📈 LLAMA2-7b Layer-1
    • 📈 LLAMA2-7b Layer-10
    • 📈 LLAMA2-7b Layer-20
    • 📈 LLAMA2-7b Layer-31

    • 📈 LLAMA2-13b Layer-1
    • 📈 LLAMA2-13b Layer-15
    • 📈 LLAMA2-13b Layer-30
    • 📈 LLAMA2-13b Layer-39
  • ✒️ 本人实验日志

✨ Exp2:Largest activation magnitudes and the median magnitude at each layer in LLMs.

  • 🧾 源论文实验结果
    • 源图 Figure4 源图 Figure4
  • 🔍 本人实验结果
    下图仅展示LLAMA-7b、LLAMA-13b结果,其余LLM实现思路一致。
    各模型展示三个种子(42、2026、10096)下的实验结果,保证普遍性。
    
    • 📈 LLAMA-7b Result under seed of {42,2026,10096}

    • 📈 LLAMA-13b Result under seed of {42,2026,10096}
  • ✒️ 本人实验日志

✨ Exp3:Intervention analysis of massive activations in LLaMA2-7B and 13B.

  • 🧾 源论文实验结果
    • 源图 Table3 源图 Table3
  • 🔍 本人实验结果
    展示结果的参数网格:{seed:42,2026; layer_id:2,20}
    呃,种子的选择基本没有影响,因为本身仅推理过程...
    
    • 📈 LLAMA2-7b Seed=42 Layer_id=2
      Intervention WikiText C4 PG-19
      Original 5.116 7.620 8.077
      Set to zero inf inf inf
      Set to mean 5.120 7.624 8.091
    • 📈 LLAMA2-7b Seed=42 Layer_id=20
      Intervention WikiText C4 PG-19
      Original 5.120 7.619 8.077
      Set to zero inf inf inf
      Set to mean 5.120 7.624 8.089
    • 📈 LLAMA2-7b Seed=2026 Layer_id=2
      Intervention WikiText C4 PG-19
      Original 5.116 7.619 8.077
      Set to zero inf inf inf
      Set to mean 5.120 7.624 8.091
    • 📈 LLAMA2-7b Seed=2026 Layer_id=20
      Intervention WikiText C4 PG-19
      Original 5.116 7.619 8.077
      Set to zero inf inf inf
      Set to mean 5.120 7.624 8.089

    • 📈 LLAMA2-13b Seed=42 Layer_id=2
      Intervention WikiText C4 PG-19
      Original 4.573 7.043 7.0149
      Set to zero 655.524 699.837 589.110
      Set to mean 238.952 200.041 187.394
    • 📈 LLAMA2-13b Seed=42 Layer_id=20
      Intervention WikiText C4 PG-19
      Original 4.573 7.043 7.015
      Set to zero 284.995 258.798 204.537
      Set to mean 4.578 7.049 7.021
    • 📈 LLAMA2-13b Seed=2026 Layer_id=2
      Intervention WikiText C4 PG-19
      Original 4.573 7.043 7.014
      Set to zero 655.528 699.819 589.093
      Set to mean 238.958 200.048 187.398
    • 📈 LLAMA2-13b Seed=2026 Layer_id=20
      Intervention WikiText C4 PG-19
      Original 4.573 7.043 7.014
      Set to zero 285.029 258.801 204.546
      Set to mean 4.578 7.049 7.021
  • ✒️ 本人实验日志

✨ Exp4:Attention patterns before and after massive activations appear in LLM.

✨ Exp5:About the values and distributions of Activations

  • 🧾 源论文实验结果
    • 源图 Table1 源图 Table1
    • 源图 Table2 源图 Table2
  • 🔍 本人实验结果
    下图仅展示LLAMA-7b、LLAMA-13b结果,其余LLM实现思路一致。
    实验参数网格:{seed: 42, 2026; layer_id: 2, 15}
    该实验结果也可以看出,起始层和结尾层的超级激活值特征不明显;下图只标出中间层的超级激活之;
    
    • 📈 Table1 seed=42 layer_id=2

      Model Top 1 Top 2 Top 3 Top 4 Top 5 Top-10 Top-100 Top 1% Top 10% median
      LLaMA2-7B 2483.4600 1464.2400 769.9925 461.7525 160.8406 54.4975 3.8934 0.1077 0.0535 0.0188
      LLaMA2-13B 91.8762 80.0900 40.9753 34.9484 31.4344 7.0844 1.8285 0.1203 0.0608 0.0212
    • 📉 Table2 seed=42 layer_id=2

      Model Top 1 Top 2 Top 1% Top 10% Median
      LLaMA2-7B 2483.4600 ± 201.6950 -1464.2400 ± 118.3621 -0.0131 ± 0.1075 0.0021 ± 0.0538 -0.0008 ± 0.0189
      LLaMA2-13B -91.8762 ± 5.3607 -80.0900 ± 12.7943 -0.0025 ± 0.1209 -0.0049 ± 0.0609 0.0023 ± 0.0212
    • 📈 Table1 seed=42 layer_id=15

      Model Top 1 Top 2 Top 3 Top 4 Top 5 Top-10 Top-100 Top 1% Top 10% median
      LLaMA2-7B 2497.5700 1472.3900 782.7950 468.3200 154.7988 46.8253 9.9369 0.9760 0.5701 0.2266
      LLaMA2-13B 1271.2700 787.0900 70.1469 64.9359 53.2294 40.5575 11.7909 1.0746 0.6311 0.2511
    • 📉 Table2 seed=42 layer_id=15

      Model Top 1 Top 2 Top 1% Top 10% Median
      LLaMA2-7B 2497.5700 ± 201.8074 -1472.3900 ± 118.5022 0.0571 ± 0.9794 0.0459 ± 0.571 -0.0009 ± 0.2278
      LLaMA2-13B -1271.2700 ± 12.3049 -787.0900 ± 44.7056 -0.1714 ± 1.0663 0.0274 ± 0.6338 -0.0097 ± 0.2522
    • 📈 Table1 seed=2026 layer_id=2

      Model Top 1 Top 2 Top 3 Top 4 Top 5 Top-10 Top-100 Top 1% Top 10% median
      LLaMA2-7B 2529.5000 1491.1800 769.8650 459.7175 159.7562 52.9612 3.9493 0.1078 0.0535 0.0188
      LLaMA2-13B 92.2856 79.5378 41.0412 35.2935 31.1086 7.1793 1.8688 0.1207 0.0609 0.0212
    • 📉 Table2 seed=2026 layer_id=2

      Model Top 1 Top 2 Top 1% Top 10% Median
      LLaMA2-7B 2529.5000 ± 190.8036 -1491.1800 ± 111.8119 0.0062 ± 0.1082 0.0032 ± 0.0537 -0.0004 ± 0.0189
      LLaMA2-13B 92.2856 ± 3.5321 -79.5378 ± 11.9228 -0.0105 ± 0.1208 0.0072 ± 0.0608 -0.0049 ± 0.0207
    • 📈 Table1 seed=2026 layer_id=15

      Model Top 1 Top 2 Top 3 Top 4 Top 5 Top-10 Top-100 Top 1% Top 10% median
      LLaMA2-7B 2543.7400 1499.3700 782.6300 466.2175 154.0350 44.9828 9.8195 0.9751 0.5694 0.2262
      LLaMA2-13B 1270.3000 781.8750 58.4928 53.0266 41.4734 33.2675 11.6262 1.0717 0.6295 0.2504
    • 📉 Table2 seed=2026 layer_id=15

      Model Top 1 Top 2 Top 1% Top 10% Median
      LLaMA2-7B 2543.7400 ± 190.9264 -1499.3700 ± 111.9376 0.1537 ± 0.9680 -0.0349 ± 0.5714 -0.0182 ± 0.2267
      LLaMA2-13B -1270.3000 ± 13.3132 -781.8750 ± 7.7075 -0.0203 ± 1.0770 0.0507 ± 0.6308 -0.0445 ± 0.2477
  • ✒️ 本人实验日志

✨ Exp6:Activation trajectory starting from input hidden states to query, key and value states.

  • 🧾 源论文实验结果
    • 源图 Figure7 源图 Figure7
  • 🔍 本人实验结果
    LLAMA2-7b 模型
    实验参数网格:{seed: 42, 2026; layer_id: 3, 15}
    
    • 📈 LLAMA2-7b Result seed=42 layer_id=3
    • 📈 LLAMA2-7b Result seed=42 layer_id=15
    • 📈 LLAMA2-7b Result seed=2026 layer_id=3
    • 📈 LLAMA2-7b Result seed=2026 layer_id=15

    • 📈 LLAMA2-13b Result seed=42 layer_id=3
    • 📈 LLAMA2-13b Result seed=42 layer_id=15
    • 📈 LLAMA2-13b Result seed=2026 layer_id=3
    • 📈 LLAMA2-13b Result seed=2026 layer_id=15
  • ✒️ 本人实验日志

✨ Exp7:Explicit Attention Biases Eliminate Massive Activations.

  • 🧾 源论文实验结果
    • 源图 Figure9 源图 Figure9
    • 源图 Figure10 源图 Figure10
  • 🔍 本人实验结果
    模型: GPT-2,基于nano GPT.
    实验参数网格:{layer_id: 5, 8; sample_seq: "Summer is warm. Winter is cold.", "I love computer science and computer vision."}
    
    • 📈 Sample_seq="Summer is warm. Winter is cold."

    • 📈 Sample_seq="I love computer science and computer vision."
    • 📈 LLAMA2-7b Result seed=2026
  • ✒️ 本人实验日志

About

Jittor version of 《Massive Activations in Large Language Models》

Topics

Resources

Stars

Watchers

Forks

Contributors

Languages