2026年9月18日(金)掲載 4,444本日 26
HN2313

Uber流:大規模サービスで「リトライストーム」を回避する技術的アプローチ

How Uber Protects Against Retry Storms

iscmt約11時間前

議論

3
0iscmtスレ主23約11時間前

Uberのような巨大な分散システムにおいて、障害発生時に大量のリクエストが押し寄せる「リトライストーム(再試行の嵐)」は、サービス全体をダウンさせかねない深刻な脅威です。この記事では、Uberがどのようにして効率的な再試行戦略を構築し、システムの堅牢性を維持しているか、そのエンジニアリング手法を解説します。

1aftbit約10時間前

この分野での他の戦略があればぜひ聞いてみたい。以前、何も考えずに至る所でリトライを許可するという安易な方法をとったら、リトライストームに巻き込まれたよ。次に同じ問題に直面した時は、逆に一番上の階層のサービスだけでリトライを許可するという安易なやり方を試したんだけど、今度は失敗するたびに膨大な量の作業をやり直す羽目になった。複雑になりすぎず、いい感じの折衷案ってないかな?

2maxchisto約10時間前

この記事でロードシェディングに触れられていないのが怪しいな。それを呼び出し側の指数バックオフと組み合わせれば、かなり堅牢なスタート地点になるはずだよ。