测试 / QA → AI 工程师转行指南
你的王牌:LLM 输出「没有唯一正确答案」
传统测试断言对错,AI 应用测试设计的是质量度量与风险防线——这正是大模型工程最缺人的一环。企业把模型接进生产环境后,最先失控的就是效果回归、幻觉率、注入攻击面。你的领域经验在这里重新定价。
- 平移点一:评测体系设计——评测集构建、指标定义 → RAGAS / LLM-as-a-Judge;
- 平移点二:攻防思维——异常输入、边界用例 → Prompt 注入防御;
- 平移点三:自动化基建——回归流水线 → 测试 Harness 与 LLM 评测专题。
学习路径
- LLM 基础概念 ⭐ 题 + Python 工程基础(补语言短板);
- 学透 RAG 系统⭐题——大多数被测对象是 RAG 应用,不懂被测物设计不出好用例;
- 主攻 AI 安全与评估路线对应专题;
- 顺手补一层开发能力(Prompt + 简单 RAG Demo),让自己能"造出被测系统",就业面立刻宽一倍。
项目建议
为某个开源问答应用写一份完整的评测方案与实施报告:评测维度、数据集、指标结果与改进建议。这份文档在面试里的说服力不亚于一个开发项目。