Skip to content

面试题

本章按初级、中级、高级三个层次整理 Benchmark + Evaluation 相关面试题,覆盖评估维度、LLM-as-judge、trace-based 评估、回归检测、AIOps 等核心话题。

初级

1. 为什么 AI 系统不能只靠传统监控(如 Prometheus + Grafana)保证质量?

参考答案要点:传统监控关注可用性、延迟、错误率等接口层指标;AI 系统即使 HTTP 200、延迟正常,也可能出现幻觉、事实错误、工具误用、输出质量下降。需要增加语义层评估(correctness、factuality、tool accuracy、safety)。

2. 列举至少三个 AI 系统特有的评估维度。

参考答案:正确性、事实性、工具使用正确性、安全性、鲁棒性、延迟、成本。可结合场景说明权重差异。

3. 什么是黄金数据集(Golden Set)?它有什么优缺点?

参考答案:黄金数据集是人工标注的、带有期望输出的数据集。优点是可信度高、适合回归测试;缺点是构建成本高、可能无法覆盖真实分布变化。

4. 离线评估和在线评估有什么区别?各适用于什么场景?

参考答案:离线评估使用预先准备的数据集,成本低、可复现,适合 CI 门控与模型选型;在线评估基于真实流量,能发现长尾问题,适合生产监控与 A/B 验证。

5. 什么是 LLM-as-judge?举一个适用场景。

参考答案:用另一个 LLM 对模型输出打分或做 pairwise 比较。适用于开放性答案评估(如创意写作质量、回答相关性),因为规则匹配难以覆盖。

中级

6. 如何设计一个评估 Agent 工具调用正确性的 evaluator?

参考答案要点

  • 解析 trace 中的 tool call span,检查调用的工具名称是否正确。
  • 校验参数是否符合 JSON Schema,必填字段是否完整。
  • 检查工具返回是否被正确消费,是否产生预期副作用。
  • 对多步骤 Agent,检查调用顺序是否符合预期计划。
  • 对错误注入场景,测试 Agent 是否能正确重试或报错。

7. LLM-as-judge 有哪些常见偏见?如何缓解?

参考答案要点:位置偏见、长度偏见、自我偏好、标准漂移、提示词依赖。缓解方法包括:多 judge 投票、固定温度、使用 CoT 理由、用黄金集校准、按维度 rubric 评分、低置信度转人工复核。

8. 如何在 CI 中集成评估门禁?应该设置哪些规则?

参考答案要点

  • 在 CI pipeline 中增加离线评估步骤,生成报告。
  • 设置硬门(如安全必须 100% 通过、总体分数 ≥ 阈值)和软门(如某能力下降超过 x% 告警)。
  • 分层评估:PR 轻量、发布前全量。
  • 把结果输出到 PR comment、dashboard、邮件。
  • 评估失败时提供失败样本与 diff,便于快速定位。

9. 影子评估(Shadow Evaluation)是什么?有什么优缺点?

参考答案要点:新版本与旧版本同时接收真实流量,新版本不返回给用户,仅用于评估。优点是安全、能反映真实分布;缺点是成本 doubled、需要严格隔离、不直接获得用户反馈。

10. 如何评估 RAG 系统的检索质量与生成质量?

参考答案要点

  • 检索质量:Context Precision、Context Recall、Context Relevancy、Entity Recall。
  • 生成质量:Faithfulness(答案是否被检索片段支持)、Answer Relevancy、Correctness。
  • 可结合人工标注与自动指标,注意引用溯源与幻觉检测。

高级

11. 设计一个端到端的 Benchmark + Evaluation 平台,需要哪些核心模块?它们如何协作?

参考答案要点

  • Agent/App + Instrumentation SDK → Telemetry Store。
  • Benchmark Registry 管理数据集与任务。
  • Evaluation Engine 批量运行 evaluator(规则、embedding、LLM judge、代码执行)。
  • Scoring & Aggregation 计算指标与回归。
  • Experiment Tracking 记录实验上下文。
  • CI Gate 阻止 regression。
  • Human Review Queue 处理低置信度与高影响样本。
  • Dashboard / Alerting / Report Generator 输出可视化与报告。
  • 最终反馈给 CI/CD、模型选择、Prompt、工具、guardrails。

12. 当新版本在某项能力上分数下降时,你会如何定位根因?

参考答案要点

  • 先看是全局下降还是特定能力下降,特定输入类型是否集中。
  • 用 trace 回放失败样本,观察模型、Prompt、工具、检索哪个环节变化。
  • 做 ablation:只换模型、只换 Prompt、只换检索,看影响。
  • 对比成本 / 延迟变化,判断是否因压缩、截断、降级导致。
  • 与安全、产品团队确认是否因策略收紧导致可用性下降。

13. 如何防止团队"刷"评估指标?

参考答案要点

  • 多指标综合,避免单一指标成为唯一目标。
  • 定期用 A/B 测试验证离线指标与在线业务指标的相关性。
  • 引入对抗性评估与红队,主动寻找系统弱点。
  • 人工抽检与 judge 校准,发现自动评分的系统性偏差。
  • 把失败案例与根因修复纳入绩效考核,而非只看分数。

14. 在线评估中,如何在成本与覆盖率之间做权衡?

参考答案要点

  • 按风险与能力分层:安全、核心能力 100% 评估;长尾能力采样 1%-10%。
  • 先用规则 / embedding 做低成本初筛,高价值样本再用 LLM judge。
  • 对影子评估按流量比例开启,设置月度预算。
  • 用缓存避免对相同输入重复评估。
  • 持续监控评估成本占总体 AI 成本的比例,设置告警。

15. AI SRE 中的 AIOps 如何与 Benchmark + Evaluation 结合?

参考答案要点

  • AIOps 从 metrics/logs/traces 中检测异常;Evaluation 把异常转化为质量分数与失败模式。
  • 用评估指标作为 AIOps 的输入特征(如幻觉率突增、工具错误率上升)。
  • 用 AIOps 对失败样本做聚类与根因推荐。
  • 用 LLM 自动生成 postmortem、runbook 更新建议。
  • 两者共同构成"可观测性 → 评估 → 告警 → 修复"的闭环。

小结

面试题覆盖了从概念理解到系统设计的不同深度。回答时应结合具体项目经验,展示对评估目标、工具选择、偏见控制、生产落地、组织协作的全面思考。下一章提供延伸阅读与跨主题链接。

Released under CC-BY-SA-4.0 License.