Windows Training Speed Issue - Solution
Environment:
- Windows 11
- Python 3.11
- PyTorch 2.5.1 + CUDA 12.4
- RTX 3090 Ti
- Dataset: CMU only (1867 train / 207 test files)
Problem:
Training was extremely slow on Windows (~68 seconds per epoch) compared to the paper's reported ~2 hours.
Root Cause:
Windows multiprocessing overhead with dataloader_num_workers causes significant slowdown.
Solution:
Set dataloader_num_workers: 0 in [options/train_avatarposer.json]
Results:
| num_workers |
Speed |
| 16 (default) |
~68s/epoch |
| 4 |
~16s/epoch |
| 0 |
~2.3s/epoch ✓ |
With num_workers=0, training speed matches the paper's benchmark (~2.4s/epoch on Linux).
Windows Training Speed Issue - Solution
Environment:
Problem:
Training was extremely slow on Windows (~68 seconds per epoch) compared to the paper's reported ~2 hours.
Root Cause:
Windows multiprocessing overhead with
dataloader_num_workerscauses significant slowdown.Solution:
Set
dataloader_num_workers: 0in [options/train_avatarposer.json]Results:
With
num_workers=0, training speed matches the paper's benchmark (~2.4s/epoch on Linux).