每天听简报,了解最新科技、AI、软件资讯
Uber工程团队公开了一套治理重试风暴的机制,叫错误所有权。一个服务只要出错,请求量会在每一跳被重试放大,一次故障沿七层调用链传下去,请求量能翻到八倍。他们的做法是,只让离故障最近的那一环去重试,上游服务收到错误后不再跟着重试。二零二五年十一月十八日,Uber核心服务真出过一次大故障。靠这套机制,系统自动挡下了九百五十万条涌向故障服务的多余请求,其中离故障最近的调用方,有的被拦下了二十万次重试。上线以后,调用图里重试风暴能波及的最大深度,从二十五层降到了三层,平均深度从二十降到了二。评论区提醒,这套方案没提限流和排队论,单靠错误所有权还不算完整方案。
进度保存在本设备 · 登录同步