返回企业 AI 落地
已脱敏已脱敏内测已跑通

某美术培训机构的教务 AI 系统(一期:学生答疑)

把「老师反复回答同一批美术问题」变成可维护的知识库:答得上来自动答, 答不上来转人工,并把这个问题补回知识库。 这是该校教务 AI 系统里第一期落地的一段 —— 全部需求有 8 条,答疑只是其中 1 条。

行业美术培训 / 教育交付形态可部署的知识库问答系统 + 知识入库流程
时间2026-09分级L2(对外脱敏)

脱敏声明 — 本项目是替服务对象做的内部系统,经沟通后以脱敏形式展示: 不出现客户名称、账号信息与可反查的内部细节。数字为该版本在验证环境下的实测结果。

问题

培训业务里,老师每天要回答大量重复的基础问题:透视怎么练、UV 为什么拉伸、画面为什么发灰。 这些问题有标准答案,但答案散在聊天记录和老师脑子里——新人接手要重新问一遍, 老师在忙的时候学生只能等。

客户自己总结的第一痛点其实不是"问答不够聪明",而是信息散在好几个平台、靠人工每天搬一遍: 课程平台、报名表、群聊、Excel 里同一个人名字都不一样,通知、回访、到课率统计全靠人盯。

范围:全部需求有 8 条,这一期只做 1 条

选答疑打头阵,不是因为它是最大的那块,而是因为它不需要等任何外部接口就能先跑起来、先见到效果。 其余部分(跨平台学生主档、QQ 群定时通知、到课率报表、1v1 预约、作业批改模板、异常预警、管理看板) 依赖客户给表结构与第三方平台接口,排在后面分期做。

这一页只写已经跑通的那一段。规划中的部分属于「能做」,不属于「做过」——两者不能混在一张页面上说。

做法

一、不建后台,先填表。 让老师填一张 CSV(标准问、相似问、反例问、答案),不碰任何系统。 这一步是刻意的:门槛越低,知识才收得上来。

二、把「问法」当一等公民。 一条知识配 3–10 个相似问。 同一句话不同人问法差别很大,只有标准问会大量漏答。

三、反例问挡住「听起来对」的错答。 每条知识可以标一条反例问: 语义相近但答案不同的问题。没有反例问,检索迟早会用一个听起来对的答案回答一个其实不同的问题。

四、阈值宁可保守。 相似度不达标就不答、转人工。 错答的代价远大于漏答——学生会被错误知识带偏,而漏答只是多问一次老师。

五、未命中回写。 每次答不上来的问题都被记录下来,变成待补清单; 老师补一条,下次同类问题就能命中。这套动作每周固定做一次。

六、不训练模型,走检索。 客户原话是"用过往优秀回复语料训练",改成了知识库检索实现: 不训练、可随时增量、答案可溯源、成本低一个量级。

结果

用 22 条问答对、67 条相似问做了验证:18 道测试题命中 14 道(77.8%),零误命中。 未命中的 4 条全部是故意留出的知识缺口——也就是说,模型没有乱答,只是知识库里确实没有。

端到端响应 2–3 秒,其中对话模型 1011 毫秒、向量检索 207 毫秒。

这几个数字要说清边界:它们证明的是系统链路跑通、阈值策略有效, 不是"上线后学生的问题能答上 77.8%"。真实语料进来之前,那个数字无从谈起。

边界

这套东西的上限由知识整理决定,不由模型决定。没有现成问答可归集、又没人愿意整理的情况下, 换任何模型都救不了。需要精确数字的场景(报价、条款)也不能靠它,得走结构化取数。

另外两件事是主动不做的:个人微信侧的自动化(外挂违规), 以及绕过平台限制去爬第三方数据。这两条都能做,代价是你的账号和合规风险——所以不在方案里。

证据

实测数字

指标实测说明
首答命中率77.8%(18 题命中 14 题)样例语料上的实测:22 条问答对 / 67 条相似问;未命中的 4 条全部是故意留的知识缺口
误命中0 条阈值策略:宁可漏答也不错答
检索得分0.803 / 0.711原话提问 / 语义改写提问
响应耗时2–3 秒含一次模型调用(对话 1011 ms + 向量 207 ms)
语料现状22 条样例问答对真实业务语料待教务提供 30–50 条;语料为空时系统会拒答,这是正确行为不是故障
限制

这个方案不适合什么

命中率是与知识库质量绑定的:知识不整理、不补充,命中率就不会涨——瓶颈从来不是模型。

真实业务语料目前一条都没有。上面 77.8% 是样例语料上的结果,它证明的是链路通,不代表上线后的业务效果。

需要精确计算的问答(报价、库存、条款)不能只靠检索,要另做结构化取数。

目前是单轮问答;多轮会引入上下文污染,反而拉低命中率,需要多轮的场景要单独设计。

本项目为服务对象内部系统,以脱敏形式展示,数字取自该版本的本地验证环境。

脱敏说明 —— 本项目是替服务对象做的内部系统,经沟通后以脱敏形式展示:不出现客户名称、账号信息与可反查的内部细节。数字为该版本在验证环境下的实测结果。