返回社区动态
L
lin_yi
编辑推荐
#工程实践
#RAG

我们如何把 RAG 的首字延迟压到 800ms 以内

先把问题拆成检索、重排、上下文组装和模型生成四段,再逐段建立可观测指标。最终通过缓存热门查询、并发召回和流式输出,把首字延迟稳定在 800ms 以内。

860 浏览

DISCUSSION

评论讨论

12 条评论
F
flux_demo

这个拆解很有帮助,尤其是把首字延迟拆成四段之后,排查路径清晰很多。

C
chen_mo

想了解一下重排模型和缓存策略是怎么取舍的?