DC娱乐网

面了一AI测试候选人,连幻觉和Prompt分不清 面了一个男生,简历上写着"熟悉

面了一AI测试候选人,连幻觉和Prompt分不清
面了一个男生,简历上写着"熟悉大模型评测",结果问到怎么测幻觉、怎么做Prompt注入防御,全程在绕圈子,场面一度有点尴尬。干脆把常问的AI测试基础题整理出来,想入行或者准备面试的可以拿来摸摸底,看看自己到底在哪个段位。

一、AI测试基础认知
Q1:AI测试和传统软件测试最核心的区别是什么?
Q2:大模型输出具有不确定性,你怎么设计断言?
Q3:什么是大模型幻觉?测试中怎么发现和量化?
Q4:什么是Prompt注入?能举一个最简单的攻击例子吗?
Q5:什么是数据漂移和概念漂移?上线后怎么检测?

二、评测方法论
Q6:LLM-as-Judge的原理是什么?有什么局限性?
Q7:Golden Set怎么构建?多少条算够用?
Q8:评测大模型回答质量,常用哪些指标?各自侧重什么?
Q9:同一个Prompt跑多次结果不同,你怎么判断用例通过?
Q10:困惑度和生成质量一定正相关吗?为什么?

三、RAG系统测试
Q11:RAG系统回答不准,可能出在哪些环节?怎么逐层排查?
Q12:检索链路重点测什么?生成链路重点测什么?
Q13:知识库文档更新后,怎么验证模型回答是否同步更新?
Q14:向量检索的召回率和准确率怎么评估?
Q15:Chunk切分策略不同,对最终回答质量有什么影响?

四、Agent测试
Q16:Agent调用工具失败,你的重试和兜底机制怎么设计?
Q17:Agent出现死循环怎么检测和处理?
Q18:怎么测试Agent的任务拆解能力和工具选择合理性?
Q19:多Agent协作场景,一致性问题怎么验证?
Q20:Agent的Token消耗和执行耗时怎么监控和优化?

五、安全与性能
Q21:越狱攻击有哪些常见手法?怎么构建越狱测试集?
Q22:大模型推理服务的首Token延迟、吞吐量怎么测?
Q23:高并发场景下KV Cache的效果怎么验证?
Q24:模型量化后精度损失怎么评估?容忍度怎么定?
Q25:敏感信息泄露风险怎么测试?

六、工程化落地
Q26:怎么把AI评测集成到CI/CD流水线里做质量卡点?
Q27:模型迭代后,回归测试策略怎么设计?
Q28:A/B测试对比两个模型版本,核心看哪些指标?
Q29:线上模型效果下降,你的排查流程是什么?
Q30:怎么搭建一套可持续运行的AI质量监控看板?

Agent测试 AI测试工程师 面试经验 软件测试学习 软件测试求职 模型评测 软件测试 测试开发 接口测试