AI for non-engineers

把 AI 黑话,变成可以行动的判断。

一套面向非技术背景学习者的实用 Wiki。它不要求你会训练模型,而是帮助你在 vibe coding 中看懂方案、识别半成品,并推动系统真正上线。

从一个真实问题开始,而不是从术语表开始。

按工作中遇到的问题,进入对应专题。

01

模型与 Prompt

通用模型、专用模型、微调、蒸馏和模型路由:该买、该训,还是该组合。

02

数据与标注

金标准、双人标注、抽样和数据闭环:数据不只是“越多越好”。

03

效果评估

把 Kappa、ECE、nDCG 和置信区间翻译成业务可以判断的语言。

04

产品化与上线

从离线评测、影子流量、A/B 测试到监控回滚,建立可上线、可维护的流程。

05

Vibe Coding 判断力

识别概念、Demo、原型和生产系统之间的真实差距,知道下一步该补什么。

“能演示”与“能上线”,中间隔着五个阶段。

  1. 概念讲清问题与核心术语。
  2. 可运行 Demo在少量样本上跑通。
  3. 离线验证在代表性数据上达标。
  4. 灰度验证用小流量验证收益与风险。
  5. 生产可用具备监控、回滚、成本与责任人。

接下来九篇,围绕“怎样做成生产系统”。

  1. 没有标注数据,评分器从哪里来?
  2. 为什么“至少 1,000 个样本”不是拍脑袋?
  3. Kappa、一致率和 ECE 到底在衡量什么?
  4. nDCG@10 为什么比平均分更接近搜索体验?
  5. 怎样把一个 Prompt 变成可上线的评分系统?
  6. 离线评测通过,为什么线上仍可能变差?
  7. A/B 测试、显著性与非劣检验是什么?
  8. 模型蒸馏:怎样让大模型教会便宜的小模型?
  9. 什么叫生产级:从 Demo 到运营还缺什么?

一份内容,两个可访问的版本。

REDoc · 内部主站

承载协作、评论和知识沉淀。每篇文章都保留返回 Wiki 首页的链接。

Vercel · 镜像备份

提供独立访问与备份。正文、更新时间和互链与 REDoc 同步发布。