AI 教程
-

Qwen3-Coder 30B 本地部署教程:5 步搭一个代码不出本机的 AI 助手
Ollama + Qwen3-Coder-30B-A3B + Continue 实战:30 分钟搭一个合规可用的本地 AI 编程助手,含硬件清单、5 步实操与常见坑。
-

把 RAG 检索评估从 0 到 1:Ragas + Langfuse 30 分钟搭可观测离线评估流水线
Ragas 算指标 + Langfuse 看 trace,搭配 GitHub Action 定时跑,把 RAG 调优从靠感觉改成靠数据。
-

生产级 RAG 缓存实战:查询/嵌入/答案三层拆解与 5 步落地节奏
RAG 系统隐性成本在重复算。把缓存拆三层、Query 模糊匹配、Embedding 分桶、Answer 分 TTL 4 个关键设计。
-

RAG 进阶:从基础检索到 GraphRAG 的工程化路径
基础 RAG 在跨文档实体关联、时间线推理、汇总型问题三个场景上表现很差。GraphRAG 通过实体抽取+图谱构建+社区检测三步把这三个场景的回答质量从 41% 拉到 78%。本文讲清楚什么时候值得上、怎么上、成本怎么控。
-

MCP 协议开发实战:15 分钟为你的 SaaS 接入 LLM 工具调用
MCP 把 LLM 客户端调用外部工具的胶水代码统一成了 JSON-RPC 协议,服务端实现一次,Claude Desktop、Cursor、Cline 全都能用。本文用 Python 写一个最小可用的 MCP server,梳理安全细节和常见坑。
-

LangGraph vs CrewAI vs AutoGen:多 Agent 框架横评
三个头部多 Agent 框架 2026 年真现状:LangGraph / CrewAI / AutoGen 各适合什么场景。本文给一个对照 demo + 选型决策树。
-

Function Calling 进阶:并行调用、延迟调用与人工接管
Function Calling 不是传参数,是分布式系统工程。本文整理并行、延迟、自纠、人审、限速、工具描述工程六套生产级模式。
-

32GB 内存跑 70B 模型:量化方案与精度实测
70B 不是 32GB 禁区。本文用 AWQ / GPTQ / GGUF + llama.cpp 三套实测数据,回答什么配置下能跑、能跑多快、质量损失多少。
-

Dify 实战:在企业内部 30 分钟搭一个 AI 助手
Dify 把 RAG / Agent / 工作流编排做到可视化。本文带你在内部服务器上从零搭一个可用 demo,覆盖模型供应商接入、知识库、应用三步。
-

用 vLLM 自托管一个生产级推理服务的完整流程
2026 年生产级 LLM 推理的事实默认:vLLM。本文从 GPU 选型、Docker 启动、调优参数、生产化监控四个阶段带你搭一套 OpenAI 兼容推理服务。