From 48f18788dc437af2a89fa062c5bde06cef05fc78 Mon Sep 17 00:00:00 2001 From: Alexander Dallmann Date: Mon, 30 Sep 2024 09:13:53 +0200 Subject: [PATCH] Fix: ScaledDotProductAttention.forward throws AttributeError when executed within `enable_torch_sdp` --- curated_transformers/layers/attention.py | 2 +- 1 file changed, 1 insertion(+), 1 deletion(-) diff --git a/curated_transformers/layers/attention.py b/curated_transformers/layers/attention.py index d72c9f60..0ea0875a 100644 --- a/curated_transformers/layers/attention.py +++ b/curated_transformers/layers/attention.py @@ -708,7 +708,7 @@ def forward( key=key, value=value, attn_mask=logit_mask, - dropout_p=self.dropout_prob if self.training else 0.0, + dropout_p=self.dropout.p if self.training else 0.0, ) # Torch SDP returns NaNs for pieces where every is piece masked out.