AIE

AI 工程化

Token 账单失控?LLM 语义缓存从原理到生产级落地实战

精确匹配缓存只能抓住逐字重复的请求(约占生产流量 18%),而「意思一样、说法不同」的大量重复查询依然在烧 Token。本文从客服 Agent 的真实成本痛点出发,系统拆解 LLM 语义缓存(Semantic Cache)的底层原理——嵌入向量、余弦相似度、阈值判定,给出基于 Redis Stack 与 GPTCache 的两套可复现代码(含 context_hash 防上下文污染、阈值校准脚本),并结合 Respan/Azure/NDSS 实测数据,讲透相似度阈值权衡、缓存失效、缓存投毒等生产级难题。读完你能独立评估并落地一套命中率 30-55%、月省 50%+ API 费用的语义缓存层。

GPU 吃不满、延迟抖不停?vLLM 生产级推理性能优化实战

大模型应用上线后,最常见的尴尬是:GPU 利用率只有 20%、首 Token 延迟忽高忽低、并发一上来就 OOM——问题的根子不在模型,而在推理引擎的内存管理与调度策略。本文以 vLLM(当前最新稳定版 v0.21.0)为单一主线,从 PagedAttention 分页式 KV Cache、连续批处理、chunked prefill 与前缀缓存四大核心机制讲透「为什么快」,再给出 6 个可直接运行的实战示例:环境搭建、离线/在线推理、生产启动脚本、压测与可观测性全链路。你还会拿到 KV Cache 使用率、TTFT、TPOT 等北极星指标的告警阈值,以及与 TensorRT-LLM、SGLang 的选型决策路径,帮你把每张 GPU 的吞吐榨到极限。