Skip to content

head-lag: subscription-death fixes in the RIGHT harness - #1019

Merged
Flotapponnier merged 1 commit into
devfrom
fix/headlag-port-950
Jul 9, 2026
Merged

head-lag: subscription-death fixes in the RIGHT harness#1019
Flotapponnier merged 1 commit into
devfrom
fix/headlag-port-950

Conversation

@Flotapponnier

Copy link
Copy Markdown
Collaborator

Contexte

Le #950 de lundi (reconnect metrics + grace) est allé dans harnesses/aggregator-latency-benchmark — un harness legacy déployé nulle part. Les services Railway buildent depuis harnesses/aggregator-head-lag (root directory). Découvert en diagnostiquant Codex/Solana figé à 26.3s pendant 8h.

Incident racine (Codex Solana, 2026-07-09)

Codex a terminé la souscription Solana côté serveur (~05h UTC, 3 régions). La connexion restait vive (bnb/base OK) donc: message complete/error avalé par le harness, pas de read timeout, gauge gelé re-scrapé "frais", alerte timestamp() aveugle. 8h de fausse donnée publiée.

Fixes

  • Port intégral de agg-latency: WS reconnect metrics + post-reconnect grace on alert gauges #950 (ws_connected, ws_reconnects_total, grace period, logs deco/reco)
  • Handling complete/error -> reconnect + resubscribe immédiat
  • Watchdog de flux par chain (10 min de silence -> purge des gauges + reconnect forcé)
  • DeleteHeadLagSeries: plus jamais de valeur gelée publiée
  • AggregatorHeadLagStale: changes(head_lag_seconds[30m])==0 au lieu de timestamp()

Deploy

Structure harnesses/aggregator-head-lag/ requise (root dir des 3 services agg + Prometheus pour l'alerte).

…s (complete/error handling, flow watchdog, gauge purge, changes()-based staleness alert)
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant