
后端
#服务治理#幂等#可观测性长任务系统的可靠性,取决于能不能优雅地暂停
对话式系统可以失败重试,持续运行的 Agent 还必须支持暂停、恢复和人工接管。
陈默后端架构11 分钟阅读2,310 阅读
这是一篇来自 FLUX 编辑部的深度内容,记录真实项目中的判断、取舍和可复用经验。
短请求时代,超时通常意味着重试;进入长任务时代后,重试可能会重复扣款、重复发货或重复修改数据。工程团队需要把任务状态、幂等键和外部副作用放在同一张设计图里。
我们观察到成熟系统普遍会提供明确的暂停点:等待用户确认、等待外部系统回调,或者等待人工审核。每个暂停点都要能解释当前进度、下一步动作和恢复条件。
可靠性不是把所有异常吞掉,而是让异常变成可以被看见、被定位和被接管的状态。
编辑提示:如果你在项目中遇到类似问题,欢迎带着上下文来到社区讨论。好的问题会成为下一篇内容的起点。