MarkShareX_用AI学AI

用 AI Vibe Coding 的方式写代码,用 Rust 的安全高效跑服务,用 Markdown 的纯粹方式写文章, 用最开放的架构迎接 AI 时代,利用 AI 来学习 AI、驾驭 AI。 温馨提示:本站仅作学习交流用,所有分享内容,部分来自站长亲自实践总结,部分来自 AI(根据站长涉猎领域预设分类)自动整理网络资源生成,如有侵权敬请告知立即下架。本站内容与服务快速更新迭代中,敬请关注。 完整体验见知识库页签右下角的友情链接,不定期更新版本,数据不保留。

大模型 API 账单瘦身术:Prompt Caching 提示词缓存原理、实战与省钱避坑

你的 RAG、Agent 应用 60%–90% 的 API 费用,其实都花在重复计算同一段提示词上。Prompt Caching(提示词缓存)能在不降低任何输出质量的前提下,把输入成本砍掉 50%–90%:本文从 Transformer KV Cache 底层机制讲起,拆解 Anthropic / OpenAI / Google / DeepSeek 四大厂商 2026 年最新的缓存实现与定价模型,用 6 个可运行代码示例带你完成系统提示、RAG 文档、工具定义、多轮对话四种缓存模式的落地,并给出盈亏平衡矩阵、命中率监控与提示词排序规范,帮你告别「缓存配了账单却没降」的尴尬。

把 R1 的推理能力装进 7B 小模型:知识蒸馏从原理到生产实战

671B 的 DeepSeek-R1 推理成本高企、私有化部署门槛高,如何把它的能力"装"进 7B 小模型?本文聚焦知识蒸馏(Knowledge Distillation)这一单点技术:先拆解软标签(Soft Label)、温度缩放(Temperature Scaling)、暗知识(Dark Knowledge)、KL 散度等底层原理,厘清黑盒蒸馏与白盒蒸馏的本质差异;再给出从"教师数据生成 → 数据清洗 → 学生 SFT 微调 → 评估 → 部署"的完整可复现流水线,附 6 个可运行代码示例与生产级超参数模板。你将理解为何 7B 蒸馏模型能在 AIME 2024 拿到 55.5%、MATH-500 拿到 92.8%,以及如何用 3 小时、900 元复现一次企业级蒸馏,实现 10 倍以上的推理成本下降。

手把手驯服 Agent 的工具调用:Function Calling 原理、实战与生产避坑

大模型本质是文本生成器,"调用工具"只是它输出的一段结构化 JSON。本文从最底层的约定讲起,拆解 Tool Calling/Function Calling 的五步闭环机制,手把手用 OpenAI Responses API(gpt-5.6)实现工具注册、tool_choice 控制、并行调用、超时重试与参数校验;结合腾讯云 900 用例横评、BFCL v3 榜单与并行调用耦合测试等实测数据,给出多模型路由、Schema 工程、幂等性审计等生产级最佳实践与避坑清单。适合正在构建 AI Agent 的工程师,读完即可写出稳定、可控、可观测的工具调用层。

告别 JSON 解析噩梦:LLM 结构化输出从原理到生产实战

LLM 是文本生成器,你的业务却需要结构化数据——两者之间的鸿沟是生产环境大量隐晦 Bug 的源头:JSON 被包进 Markdown 代码块、必填字段缺失、类型错乱、幻觉字段名,正则补丁越打越多。本文从约束解码(Constrained Decoding)的底层原理讲起,拆解 JSON Schema 如何编译为上下文无关文法与有限状态机、token 概率如何被屏蔽;随后以 OpenAI / Anthropic / Gemini 三家官方最新 API 与自托管 vLLM+XGrammar 给出 7 个可运行代码示例,覆盖 Pydantic / Zod 类型系统集成、验证三明治、Instructor 重试循环与生产监控指标,并用 SqueezeBits 实测数据量化结构化输出的收益(正确率 72%→100%),给出完整的选型决策路径。

PDF 图表检索总翻车?ColPali 视觉 RAG 原理与生产实战

传统文本 RAG 在含表格、图表、复杂版式的企业文档上频繁翻车——OCR 错误累积、版面信息丢失,检索召回率始终上不去。本文聚焦视觉文档检索这一单点技术,深度拆解 ColPali/ColQwen 家族的 Late Interaction(后期交互)与 MaxSim 打分原理,从 PDF 渲染、批量建索引、多向量向量库检索到 VLM 生成答案,给出完整可复现的实战代码;并结合 ViDoRe V2 实测数据、GPU 吞吐与存储成本测算,给出模型选型、生产化部署与混合检索架构建议。适合正在构建文档知识库、金融研报问答、医疗与工程文档检索场景的 RAG 工程师。

通用 Reranker 总翻车?手把手微调你的业务域重排序模型

通用 Reranker(重排序)模型在垂直业务域经常「越排越差」,甚至拖累 RAG 检索质量——根因是预训练数据与你的领域分布错配。本文从 Bi-Encoder 与 Cross-Encoder 的本质差异讲起,深度拆解 Reranker 的注意力交互机制、损失函数(BinaryCrossEntropyLoss / ListMLE)与 Hard Negative 挖掘策略,并基于 sentence-transformers v5.5 官方 API 给出 5+ 个可复现代码示例:数据构造、训练、评估(MRR/nDCG/Recall@K)、ONNX 推理部署与两阶段检索集成。同时提供 2026 年最新 8 模型 Benchmark 实测数据(Hit@1 提升 +20.33pp)、开源/API/LLM 三类 Reranker 选型决策路径与生产级避坑清单,适合 RAG 工程与搜索团队直接落地。

GPU 吃不满、延迟抖不停?vLLM 生产级推理性能优化实战

大模型应用上线后,最常见的尴尬是:GPU 利用率只有 20%、首 Token 延迟忽高忽低、并发一上来就 OOM——问题的根子不在模型,而在推理引擎的内存管理与调度策略。本文以 vLLM(当前最新稳定版 v0.21.0)为单一主线,从 PagedAttention 分页式 KV Cache、连续批处理、chunked prefill 与前缀缓存四大核心机制讲透「为什么快」,再给出 6 个可直接运行的实战示例:环境搭建、离线/在线推理、生产启动脚本、压测与可观测性全链路。你还会拿到 KV Cache 使用率、TTFT、TPOT 等北极星指标的告警阈值,以及与 TensorRT-LLM、SGLang 的选型决策路径,帮你把每张 GPU 的吞吐榨到极限。

告别人工抽查:RAGAS 0.4 打造 RAG 质量度量与回归评估体系

RAG 系统上线后最怕"感觉还行",却说不清检索质量到底如何、优化到底有没有用。本文从企业级 RAG 评估痛点出发,深度拆解 RAG 评估三要素:检索层/生成层/系统层指标体系、LLM-as-a-Judge 评估原理、RAGAS 0.4 最新 API(collections 指标、DiscreteMetric、llm_factory)。手把手带你用 7 个可运行代码示例构建从单样本打分、批量回归到生产可观测的完整评估闭环,并给出指标联动定位故障、评估成本对比与选型决策树。适合正在上线 RAG 应用、想用数据驱动迭代的开发者与 AI 工程师。

不训奖励模型也能 RLHF?DPO 直接偏好优化从原理到生产级落地

SFT 之后模型仍爱说教、不跟指令?传统 RLHF 需要奖励模型+PPO,训练不稳定且工程极重。DPO(Direct Preference Optimization)用一条二元交叉熵损失把奖励模型"吸收"进策略目标,仅需策略+冻结参考两份权重即可完成偏好对齐。本文从 Bradley-Terry 模型三步推导 DPO 损失,讲透 beta、参考模型与隐式奖励机制;基于 TRL v1.9.2 在 Qwen3-0.6B 上完整跑通 4-bit QLoRA+DPO 训练与评测;附超参速查表、踩坑清单、成本对比与选型决策框架,助你以约 1/17 的成本完成生产级对齐。

你的 RAG 为什么"看不懂"图片?Multimodal RAG 从原理到生产级实战

企业文档中 30-60% 的信息存储在图片、图表、表格中,传统文本 RAG 对此完全"失明"。本文从底层原理到生产落地,系统讲解多模态 RAG 的三种架构模式——Caption-and-Index、Unified Embeddings、Page-as-Image(ColPali),手把手带你用 ColQwen2.5 + Qdrant 搭建完整的多模态检索流水线。包含完整可运行代码、GPU 资源规划表、ViDoRe 基准测试数据对比,以及生产环境踩坑经验总结。读完你将掌握让 RAG 系统真正"看懂"图片、图表和 PDF 页面的工程方法。

GRPO 深度实战:用 DeepSeek-R1 的强化学习方法微调推理模型

DeepSeek-R1 引爆了推理模型热潮,其背后的 GRPO(Group Relative Policy Optimization)算法功不可没。本文从 PPO 的价值模型痛点切入,深度拆解 GRPO「去价值网络 + 组相对优势估计」两大核心创新,并基于 Hugging Face TRL 库的 GRPOTrainer 从零搭建完整微调流水线。你将在实战中学会如何定义奖励函数、配置 vLLM 推理服务器、监控 KL 散度与奖励收敛,以及在生产环境中做多节点解耦部署。全文配原理图、内存公式与实测性能对比,帮你彻底掌握这一 2026 年最热门的 LLM 后训练技术。

图文不分家:多模态 RAG 从原理到实战,让大模型真正「看懂」复杂文档

传统 RAG 处理含图表、流程图、截图的 PDF 时,OCR 文本化会丢弃空间布局信息,导致检索质量断崖式下跌。本文深度拆解多模态 RAG 三种架构方案,详解 ColPali 补丁级视觉检索的 MaxSim 后期交互原理,并给出基于 ColQwen2.5 + Qdrant + Qwen2.5-VL 的完整本地部署实战代码,涵盖 ViDoRe 性能对比、GPU 选型与存储成本测算,帮你构建真正能「看懂」图文混排文档的企业级 RAG 系统。