推广 热搜: 采购方式  滤芯  带式称重给煤机  甲带  气动隔膜泵  减速机型号  无级变速机  链式给煤机  履带  减速机 

交互式测评研究进展与工具平台开发调研报告

   日期:2026-07-26 12:28:39     来源:网络整理    作者:本站编辑    评论:0    
交互式测评研究进展与工具平台开发调研报告

完成日期:2026-07-26

调研范围:国内外交互式测评(Interactive Assessment)研究进展、关键技术、工具与平台开发 
证据基座:78 条证据块(E01–E78),URL 批量验证 75 条中 58 条通过、0 条失效、17 条为出版商反爬拦截(判定有效)

摘要

交互式测评已从边缘概念发展为教育评价领域最活跃的方向之一。OpenAlex 文献计量显示,"AI 反馈·教育"主题论文从 2020 年的 98 篇激增至 2025 年的 6130 篇;"大模型×形成性评价"从 2022 年的 7 篇增至 2026 年(不完整年)的 192 篇;游戏化测评十年间增长近 4 倍(2015 年 602 篇→2025 年 2386 篇)。
干预效果证据总体积极但存在张力:计算机化动态评估(C-DA)三层元分析显示对二语表现的大效应(嵌入式 g=2.120、夹层式 g=1.676,2026 年 7 月在线发表);游戏化形成性测评合并效应值 0.775(2021);但也有对照实验发现游戏化测评"提升动机但未提升学业"的对立证据,本报告如实并存呈现。
大语言模型(LLM)正在重塑交互式测评的技术底座:对话式测评(CBA)多代理架构(AIED 2025)、LLM 反馈自动质检器(准确率 79.8%)、实时题目标定框架(DET 的 S2A3,5 小时标定 3900 万作答)成为近两年的标志性进展;但 LLM 反馈幻觉率仍达 23.5%–27.1%(EDM 2024),人在回路(human-in-the-loop)成为主流防护设计。
国内形成"政策牵引 + 理论建构 + 平台落地"三轮驱动格局:2020 年《深化新时代教育评价改革总体方案》、2025 年九部门教育数字化意见、2026 年《"人工智能+教育"行动计划》构成政策三部曲;"学评融合""第五代教育评价""人机协同评价"等本土理论相继提出;科大讯飞智学网、松鼠 AI、批改网、华东师大 InnoSpark 体系构成产业与高校自研两条平台路线。
开发技术路线呈"规则—心理计量—机器学习/大模型"三代并存:规则路线(e-rater 式特征工程)成熟稳定,IRT/认知诊断路线(CAT、ALEKS)测量学严谨,ML/LLM 路线(多代理对话式测评)交互性最强但信效度与公平性挑战突出;开源框架(Concerto、TAO、GIFT、pyKT、InnoSpark)已显著降低开发门槛。

1. 数据来源与方法说明

文献计量

使用 OpenAlex 开放学术数据库(search-works 接口,title_and_abstract.search 关键词匹配,按发表年分组计数),查询日 2026-07-26;2026 年为不完整年度,图中以虚线标注。关键词 AND 匹配口径跨学科,计数受选词影响,仅作趋势指示。

文献与事实检索

中英文并行联网检索 16+ 轮,优先采信一手/官方来源(期刊官网、会议论文集、政府文件、平台官方文档),其次专业媒体;厂商自报数据(如松鼠 AI 对照实验、批改网计数)均标注利益相关并降权处理。

学术检索源说明

Semantic Scholar 接口在调研期间持续限流(HTTP 429),高被引锚定与趋势计量改由 OpenAlex 完成,叙事性证据以期刊/会议官网原文为准。

URL 验证

全部 75 个引用链接经自动化批量验证,58 条直接通过,17 条为 MDPI/OECD/ResearchGate 等站点反爬拦截(403/412,判定链接有效),0 条失效。

2. 概念界定与理论框架

2.1 "交互式测评"作为伞概念

"交互式测评"并非单一标准术语,而是一簇共享四个特征的评价实践总称:过程性(测评嵌入学习过程而非仅在学习终点)、双向性(系统依据学生反应动态调整任务或提示)、适应性(难度、路径或反馈因人而异)、数据驱动(作答与过程数据实时转化为学习证据并触发干预),最终形成"测评—反馈—调整"闭环。国际大型测评已将其操作化:PISA 2012 创造性问题解决测评以计算机模拟情境中的"交互式"任务为核心,全部自动评分并利用过程日志参与评分;对话式测评(CBA)则被定义为学生与人工代理通过自然语言多轮对话展示知识与技能的表现性测评。

2.2 五大分支概念辨析

表格

分支
核心机制
理论基石
与"交互"的关系
动态评估 DA / 计算机化动态评估 C-DA
分级提示(中介),测查学习潜力
维果茨基最近发展区(ZPD)
交互发生在"提示—应答"的中介过程
计算机自适应测验 CAT
按作答表现动态选择题难度
项目反应理论 IRT、知识空间理论 KST
交互发生在题目选择层面
游戏化 / 隐秘测评
游戏行为日志实时转化为能力证据
证据中心设计 ECD
交互沉浸于游戏情境,测评"无感"
对话式测评 CBA
多轮自然语言对话收集证据
ECD + 对话系统
交互即测评本体
AI 形成性评价与反馈
即时评分 + 个性化反馈生成
形成性反馈理论、自我调节学习
交互发生在反馈—修改循环
动态评估(DA)植根于维果茨基社会文化理论的"最近发展区",以"中介"为关键机制,将教学与评估融为一体,分互动式(依赖专家与学习者的真实对话)与干预式(预设提示层级、可自动化)两种路径。奠基性文献 Poehner & Lantolf(2005)在 OpenAlex 被引 421 次。C-DA是其计算机化形态,干预式路径因高度结构化而具备自动化潜力,但面临线性提示链无法动态响应个体认知节奏的挑战——这正是 LLM 介入的切口。
隐秘测评(Stealth Assessment)由 Shute 提出,基于证据中心设计(ECD)的能力模型—证据模型—任务模型—组装模型四框架,把游戏中的行为流实时转化为能力证据(证据识别 EI + 证据累积 EA两过程)。ECD 本身由 Mislevy 等(2003)提出,为整个交互式测评领域提供了通用的概念设计框架。
AI 形成性评价的学理根基是形成性反馈研究:Shute(2008)《Focus on Formative Feedback》被引 4278 次、Nicol & Macfarlane-Dick(2006)形成性评价与自我调节学习模型被引 5547 次(均截至 2026-07-26),构成反馈设计的原则库。

3. 国外研究进展

3.1 文献计量趋势:三个量级层级的同步扩张

OpenAlex 计量(2026-07-26 快照)显示三个层级的同步扩张:

高产出层

"AI 反馈·教育"2020 年 98 篇→2025 年 6130 篇(五年 62 倍);"游戏化测评"2015 年 602 篇→2025 年 2386 篇。

细分主题层

自动作文评分(AES)2015 年 58 篇→2025 年 362 篇;隐秘测评 2025 年首达 100 篇;C-DA 从 2015 年 63 篇缓增至 2026 年(不完整年)97 篇。

新兴爆发层

"大模型×形成性评价"2022 年仅 7 篇,2024 年 73 篇,2026 年(不完整年)已达 192 篇——ChatGPT 发布后三年增长 27 倍。
一项基于 Scopus 105 篇文献的系统综述(2015 至 2025 年中)同样发现数字测评发文自 2020 年激增、2024 年达峰,形成性评价占比最高(55/105)。二语 DA 领域 30 年文献计量(229 篇,1994–2023)将领域划分为萌芽期(1994–2010)、发展期(2011–2017)、蓬勃期(2018–2023),并指出"技术增强的混合式 DA 在 EFL 情境中成为关键新兴趋势"。

3.2 近五年研究热点

(1)C-DA 有效性的元分析证据趋于坚实。2026 年 7 月在线发表于 RECALL 的三层元分析(中国海洋大学杨连瑞、陈瑛与香港理工大学李少锋合作)综合 2000 年至 2025-05-27 间 35 项研究:C-DA 对二语表现提升呈大效应,嵌入式(cake)g=2.120、夹层式(sandwich)g=1.676,均 p<.001。另一项独立元分析(22 项研究,2025)同样报告阅读、听力、写作大效应,但对焦虑、动机等情感因素作用温和。教学实证方面,Yang & Qian(2019)的 TOEFL 阅读 C-DA 准实验显示 4 周干预后实验组显著优于传统教学组(被引 81 次)。
上图汇总四条独立证据链的效应量:C-DA 两种实施格式均远超 Cohen 大效应阈值 0.8;智能导学系统学习收益 0.4–1.1σ 为文献综合区间;游戏化形成性测评 0.775 接近大效应。需注意 C-DA 效应量基于小样本准实验为主的研究库,可能含发表偏倚,解读时宜与游戏化测评的对立证据(见 3.2 节第(5)点)对照。
(2)LLM 自动测评与反馈成为独立综述主题。高校文本作答自动测评系统综述(2024)被引 116 次;LLM 自动测评系统综述(2025)被引 41 次(被引数截至 2026-07-26)。按 PRISMA 2020 纳入 34 项研究(覆盖 19 国)的 LLM 写作反馈综述(2026)得出关键判断:LLM 反馈利于写作产出、语言准确性、参与度与反馈素养,但人类反馈在论证发展、情境解读、修改优先级与对话式指导上仍更强,混合反馈模式最有前景。方法学上,CoTAL 将 ECD 对齐、人在回路提示工程与思维链结合,使 GPT-4 形成性评分较无提示工程基线最高提升 38.9%。
(3)LLM 反馈质量问题被系统量化。EDM 2024 研究显示数据驱动与提示驱动两类 LLM 反馈系统的幻觉内容分别占 27.1% 与 23.5%;AIED 2024 研究显示 GPT-4 对数学反馈质量的标注与人类平均一致率 76%,且倾向于在反馈"听起来有说服力"时误判为正确;系列实证还报告数学辅导对话约 50% 含错误、AI 下一步行动准确率仅 52%–70% 等问题(二手转述,原研究未逐一核验)。应对上,Monash 大学团队提出 DeanLLMs 反馈评估器(6 内容维度 + 7 有效性维度 + 3 类幻觉),微调 GPT-4.1 达人类专家水平(准确率 79.8%),用于反馈送达学生前的自动质检。
(4)对话式测评的多代理架构兴起。Hou 等(AIED 2025)基于 ECD 构建 4 个 LLM 代理(专家、同伴、形成性评估、总结性评估)+ 非 LLM 监控代理(Watcher)的 CBA 架构,在中学科学探究场景验证了证据收集的可行性。其前身可溯至 AutoTutor(Graesser 团队,1997 年起):以"期望—误解定制"对话机制开展 50–200 轮自然语言对话,学习收益 0.3–0.8σ;2018 年研究将 AutoTutor 对话数据用作低识字成人阅读理解测评工具,验证对话式测评可行性。
(5)游戏化测评:效果证据与对立证据并存。36 个独立实验的元分析显示 Kahoot 与 Quizizz 对学习结果有中到大正效应(合并效应值 0.775,Quizizz 优于 Kahoot,2021);但 NTNU 对照实验发现游戏化学生应答系统显著提升动机与参与度、却未发现显著学习提升;UPM 五年纵向研究(1000+ 工科生)则显示"坚持参与"才是学业表现最强预测因子。三者的张力提示:游戏化测评的增益可能主要通过持续投入的中介路径实现,而非游戏机制本身。
(6)自适应机制的成熟化。阿姆斯特丹大学 van der Maas 团队的 Computerized Adaptive Practice(CAP)以 Elo 评级式项目反应模型实现"边测边标定":3648 名儿童 10 个月完成 350 万道算术题,平均成功概率控制在 .75。OECD《数字教育展望 2021》判断游戏化标准化测评可测创造、协作、社会情感等复杂技能,但将作为传统测验的补充而非替代。
(7)大型国际测评的交互式转向。PISA 2012 创造性问题解决测评将"交互式"任务置于核心、44 国参加(新加坡、韩国、日本前三);PISA 2022 创造性思维测评 32 道题中 92% 为建构反应题、含交互式仿真任务,采用 0–60 有界量表。混合智能方面,HIAS 三层模型(教学层—治理层—技术层)强调人在回路验证与可规模化集成的平衡(2026-07-10 发表)。

4. 国内研究进展

4.1 政策脉络:三年三文件,评价数字化上升为国家行动

2020 年 10 月,中共中央、国务院印发《深化新时代教育评价改革总体方案》,确立"改进结果评价、强化过程评价、探索增值评价、健全综合评价"方针,明确"创新评价工具,利用人工智能、大数据等现代信息技术,探索开展学生各年级学习情况全过程纵向评价、德智体美劳全要素横向评价"。2025 年 4 月,教育部等九部门《关于加快推进教育数字化的意见》设"赋能教育评价改革"专条,提出"推动实现教学全过程、发展全要素伴随式数据采集";2026 年 4 月,教育部等五部门《"人工智能+教育"行动计划》进一步提出"推动智能命题、智能组卷、智能监考、智能评卷等应用。研发教育评价智能化工具"。政策文本的演进轨迹清晰:从"方向倡导"(2020)到"机制建设"(2025)再到"工具研发"(2026),交互式测评的装备化窗口已经打开。

4.2 理论建构:本土评价范式集中涌现

学评融合

辛涛、张生等(北师大中国基础教育质量监测协同创新中心,《开放教育研究》2025 年第 5 期)提出评价目的转向促进发展、主体转向学习者参与、技术转向动态诊断,核心技术路径为"数据层—诊断层(认知诊断模型)—推荐层"个性化学习引擎,并警示可解释性、数据伦理、数字鸿沟三重挑战。

第五代教育评价

朱雪梅(课程教材研究所,2025)梳理评价理论"测量—描述—判断—建构"四代演进,提出数智时代"智联共生性第五代评价模式"及数据治理、技术赋能、应用转化、保障支撑四维实践机制。

五个转向

蒋慧芳、曾文婕(西南大学)提出生成式 AI 推动教育评价从"甄别诊断"到"素养发展追踪"、从"教师主导"到"人机共生型评价共同体"等五个转向。

人机协同评价

刘伟等(《江苏高教》2026,CSSCI)构建"数据层—分析层—决策层—展示层"四级人机协同评价模型,微格教学案例显示机器评价与教师评价结果呈差异性,二者为能力互补而非替代;江涛、陈顺星(2026)面向初中数学构建"能力层—二级维度层—具体指标层"三级人机协同评价模型,形成"准备—评价—反思"闭环。

4.3 二语动态评估:从理论引进到 LLM 系统自研

国内二语 DA 文献 2000–2024 年共 87 篇(期刊、学位论文、书章)的综述显示:DA 提升学习者投入与表现,但受应试教育、大班额、师资培训不足制约;未来方向为 AI 辅助 DA 模型与可规模化集体中介。代表性团队有三:深圳大学张浩敏团队提出四级渐进提示机制与"实际分数+中介分数"双结果计分法,其团队研发的基于 LLM 的计算机化动态写作评估系统 DynaWrite(2025)采用松耦合微服务架构(Kafka 消息队列连接前后端 NLP 单元),GPT-4o 生成反馈可用率 68%、远高于其他开源模型的 12%;北京语言大学王建勤团队完成理论铺垫,提出"计算机辅助""群体 ZPD"模式、可操作调节等级量表与新学习潜力分数(LPS)公式;中国海洋大学团队开展语用能力 C-DA 诊断与干预实证(即 3.2 节 RECALL 元分析的合作方之一)。Frontiers in Psychology(2026-05-15)发表的国内实证(N=92,16 周)显示 AI 辅助 DA 组阅读理解显著优于对照组,并提升学业浮力与学业韧性。

4.4 心理计量与认知诊断的国内跟进

认知诊断模型(CDM)以 Q 矩阵联结题目与认知属性,输出"掌握/未掌握"技能剖面;2015–2025 年系统综述(56 篇 Scopus 文献)显示 CDA 主要应用于数学、科学与语言教育,中国、美国、马来西亚贡献最多。《心理科学》(2021)发表多级评分认知诊断模型述评,显示国内心理计量学界持续跟进。北师大刘红云团队(2018)针对 PISA 2012 过程数据提出改进的多层混合 IRT 模型(MMixIRT),可同时估计过程水平与学生水平能力。

4.5 高校自研体系:华东师大"底座+引擎+评价"三位一体

华东师大上海智能教育研究院 2026 年 7 月发布"启创·InnoSpark 3.0"教育大模型(9B/35B/397B 三规格,基于 Qwen 二次预训练,Hugging Face 开源)、"启创·InnoAgent"教育智能体平台(集成 300+ 教育智能体、1000+ 技能,GitHub 开源)与"启创·SkillJudge"技能智能评测系统,配套 ELMES/ELMES+ 评测体系(Edu-330 覆盖 330 场景、11 学科、1000+ 二级指标)。ELMES+ 用多代理(教师—学生—裁判)交互评测 LLM 教育能力,发现教育能力是多维的:顶级 LLM 差异主要在创造力与价值融合,知识强模型可能弱于苏格拉底式脚手架;LLM 裁判存在自我偏好等偏差。这是国内高校在"用 AI 测评 AI 教育能力"方向上的标志性布局,对自研交互式测评平台具有直接的框架参考价值。

5. 关键技术支撑

表格

技术
谱系与现状
代表证据
知识追踪 KT
BKT(隐马尔可夫)→ DKT(2015,RNN)→ SAKT 等注意力模型;pyKT 开源框架集成 10 种 DLKT 模型与 7 个公开数据集
计算机研究与发展
认知诊断 CDM
Q 矩阵联结题目与属性,DINA/G-DINA 主流,机器学习辅助 Q 矩阵验证
EJMSTE
过程数据挖掘
作答日志→策略识别;MMixIRT 多层混合模型
Front. Psychol.
NLP 自动评分
e-rater 1999 年起用于 GMAT/GRE/TOEFL 操作化评分,人机分差超阈值时引入人工复核
ETS
LLM 生成与质检
提示工程(CoTAL +38.9%)、自动质检(DeanLLMs 79.8%)双轮驱动
arXivarXiv
多模态
语音(Amira 朗读测评、希沃课堂分析)、视觉(e-Cube 积木认知测评)
JMIR Serious Games
值得注意的是工程落地的清醒判断:EDM 2025 产业论文在真实学习平台评估 LSTM 与 SAKT 后指出,过度关注聚合 AUC 会掩盖实际部署问题(如需大量作答才能准确预测、技能呈现顺序影响 LSTM 表现),主张结合实践条件选型。

6. 工具与平台全景

6.1 国外代表性平台

表格

平台
类型
核心交互测评机制
规模/证据
Duolingo English Test
CAT 语言测试
IRT 自适应调难度;客观题规则实时评分;口语写作 AI 评分(ASR+NLP);S2A3 框架实现新题即上即用(SPICE 5 小时标定 10 万题/3900 万作答,2025-06)
约 1 小时测试、两天出分 DET 手册DET 博客
Khanmigo(Khan Academy)
对话式辅导
将作答历史、未掌握先备技能等结构化学习信号注入模型上下文;约 20 项产品实验、60 万+线程,下一题正确率累计提升 6.1%(截至 2026-05)
$4/月,教师免费 Khan Academy
Amira Learning
AI 阅读测评
语音识别听朗读、标记错误、追踪流利度;测评+辅导一体
北达科他州 27 学区分析:高使用组三年级州考 ELA 高 15 分(2023–24 学年,厂商委托研究,注意利益相关)Amira
DreamBox Learning
自适应 K-8 数学
自适应引擎按当前水平推荐课程;发布公平性白皮书
500 万学生、ESSA Strong 评级(2024-05)Discovery Education
ALEKS
自适应学习测评
知识空间理论构建知识状态地图,Initial Knowledge Check 定位已知/未知/可学
McGraw-Hill,逾 25 年研究积累(厂商口径)McGraw-Hill
Gradescope
AI 辅助评分
相似答案自动分组、教师按组批改;动态量规可中途修改并回溯应用
Turnitin 旗下;第三方称 2600+ 所高校(未独立核验)Turnitin
Claire Labs
对话式测评新创
无代码构建音频原生 AI 代理,对学生开展动态交互式访谈(oral assurance),量规化即时反馈
宣称符合 GDPR 与欧盟 AI 法案(厂商口径)Claire Labs
Kahoot/Quizizz 等课堂应答工具
游戏化形成性测评
实时竞答+即时反馈+学情面板;九工具比较研究显示反馈机制与数据分析是选型关键
元分析合并效应 0.775 ITHET 2024

6.2 国内代表性平台

表格

平台
主体
核心交互测评机制
规模/证据
智学网
科大讯飞
智能组卷、客观题自动评分、中英文作文自动评分(手写识别+自然语言理解);学生端知识图谱诊断与推荐
最大承载 1000 万人次试卷/日;个性化学习手册覆盖 31 个省级行政区、430 余万师生(厂商口径,访问于 2026-07-26)科大讯飞
松鼠 AI
乂学教育
LAM 全学科多模态智适应大模型;纳米级知识点拆分+"五重错因分析法"根因诊断
宣称第三方评估达"L5 级";1662 名学生对照实验(AI 组五年级均分 87.58 vs 对照组 78.80)——厂商主导实验,独立性有限(2026-07-23 报道)凤凰网山东
一起教育"智慧纸笔+AI"
一起教育科技
保留纸笔习惯同时采集书写轨迹,AI 过程诊断与智能批改,个性化错题本
上海闵行区"闵智作业"覆盖 143 所中小学、十余万师生(2025-05)新华网
希沃教学大模型
视源股份
AI 督导教评(与清华大学课题合作五维评价模型)、课堂智能反馈(无感采集、约 10 分钟生成课堂分析报告)
第三方称上海 206 所中小学常态化使用(媒体口径)希沃
雨课堂
清华大学+学堂在线
PPT×微信的课上限时测验、弹幕互动、全周期数据采集
全球 10000+ 所学校使用(2026-07 版本页)清华大学
批改网
句酷
英语作文自动评分、按句点评、相似检测、过程性写作评价
官网实时计数累计批改逾 11.67 亿篇(2026-07-26 访问,厂商自报)批改网
InnoSpark/InnoAgent/SkillJudge
华东师大
教育大模型底座+智能体引擎+技能评测三位一体;ELMES+ 多代理评测
2026-07-20 发布,开源 华东师大
区域层面,杭州"思享慧"语音互动教学系统以应答器采集全班语音作答并实时归类呈现,市平台"科学领杭"自 2025 年 3 月运行以来学生累计提问超 42 万个(2026-07 报道)。

6.3 开源框架与可复用资源

表格

资源
定位
关键特性
Concerto
开源 CAT 平台(剑桥心理测量中心发起)
基于 R 引擎,支持从问卷到 IRT 自适应测验,学术与商用免费 剑桥心理测量中心
TAO(社区版)
开源 QTI 测评平台
QTI 开放标准 100% 互操作,17 种 QTI 交互+11 种 PCI 交互,支持线性/分支/自适应测验与 LTI 对接 TAO
GIFT
开源智能导学框架(美陆军研究实验室资助)
模块化面向服务架构,含学习者建模、表现评估、教学模型组件;已办 10 届用户研讨会(178 篇论文)UPenn
pyKT
深度知识追踪基准库
集成 10 种 DLKT 模型与 7 个公开数据集 计算机研究与发展
InnoSpark/InnoAgent
教育大模型与智能体平台(华东师大)
9B/35B/397B 开源,300+ 教育智能体、1000+ 技能 华东师大
WikiHowAgent
教学对话数据与工作流
114,296 段师生对话(17 领域 727 主题),评估协议与数据全开源(2025-07)arXiv

7. 开发技术路线对比

表格

路线
代表系统
优势
短板
适用场景
规则/特征工程
e-rater、DET 客观题评分、批改网
可解释、稳定、经过高风险考试验证(1999 年起操作化)
特征设计依赖专家、泛化弱、难测高阶能力
客观题、结构化写作评分
IRT/认知诊断
DET 自适应、ALEKS(KST)、Concerto、CAP/Elo
测量学严谨、可量化精度、题库可标定扩展(S2A3 框架 5 小时标定 10 万题)
题库建设成本高、冷启动难、对开放性任务力不从心
标准化测验、自适应练习
机器学习/大模型
DynaWrite、AIED 2025 多代理 CBA、Khanmigo、SkillJudge
交互自然、可处理开放作答、反馈生成能力强(GPT-4o 反馈可用率 68% vs 开源 12%)
幻觉率 23.5%–27.1%、评分一致性 76%、公平性与隐私风险
形成性反馈、对话式测评、写作/口语评价
架构范式上呈现三个共识:其一,ECD 仍是设计方法论底座——从隐秘测评到 AIED 2025 的多代理 CBA,能力模型—证据模型—任务模型的分层思想贯穿始终;其二,微服务+消息队列成为 LLM 测评系统工程主流,DynaWrite 以 Kafka 连接前端与后端 NLP 单元实现松耦合;其三,人在回路成为质量保障的标配——HIAS 治理层要求透明与人工验证,DeanLLMs 在反馈送达前自动质检,多模态 OBE 评价系统采用"AI 客观题自动评分 + 教师开放题复核仲裁"机制。题目供给端,SPICE 式"贝叶斯标定+NLP 题目特征"的实时标定框架与 e-Cube 式题目生成器,正在缓解 CAT 题库建设的核心瓶颈。

8. 趋势与挑战

8.1 五大趋势

C-DA 的技术增强化

二语 DA 文献计量确认"技术增强混合式 DA"为关键新兴趋势,LLM 使干预式 DA 的线性提示链有望升级为动态生成的个性化中介。

LLM 形成性反馈主流化

发文三年 27 倍增长,混合反馈(AI 建议+教师中介)成为最有前景模式。

对话式测评与"口试复兴"

在 AI 代写作业防不胜防的背景下,动态交互式访谈作为真实性核验手段兴起,商业侧已有 Claire Labs 等落地。

过程数据与多模态测评下沉课堂

语音应答器、智慧纸笔、课堂无感采集使伴随式数据采集进入常态化教学。

政策牵引的工具化窗口

中国 2026 年"人工智能+教育"行动计划明确"研发教育评价智能化工具";美国学校实践中 Khanmigo、Amira 已进入区域规模化应用。

8.2 四类挑战

信效度

LLM 反馈幻觉率 23.5%–27.1%(EDM 2024);GPT-4 易被"听起来有说服力"的错误反馈蒙蔽;数学反馈系统评估显示潜力与挑战并存。

公平性

AI 检测器更易将非英语母语者写作误判为 AI 生成;94% 的 AI 生成作业混入真实测评系统未被发现(二手转述);以城市数据训练的 AI 监考将农村网络延迟误判为作弊、以标准英语训练的评分器误判皮钦语正确表达等案例被"技术—政策—实践"框架系统归纳。

隐私与治理

生成式聊天机器人教育伦理系统综述(2026-07-15,纳入 16 项研究)归纳学生数据隐私、学术诚信、算法偏见、机构治理四大伦理域;剑桥研讨会报告警示数字监控常态化与测评判断终身跟随学生的风险。

人的因素

学生对 AI 评分感知呈混合态度,透明度与一致性是信任关键;去人性化与教师专业判断退化被列为长期隐忧;国内"学评融合"框架同样警示数字鸿沟衍生的公平困境。

9. 结论与建议

交互式测评正处于"理论成熟期 × 技术爆发期 × 政策窗口期"三期叠加的历史节点。对高校研究者与平台开发者,本报告给出四条建议:

概念选型先于技术选型

DA/C-DA 适合测"学习潜力"、CAT 适合高效测量、CBA 适合深度理解与真实性核验、游戏化适合动机与低焦虑场景——按测评目的选择分支,再匹配 ECD 设计流程。

采用"心理计量+LLM"的混合架构

以 IRT/认知诊断保证测量的严谨性,以 LLM 承担交互与反馈生成,以人在回路(教师复核+自动质检器)兜住幻觉底线——这是 DynaWrite、HIAS、DeanLLMs 三条独立证据链的共同指向。

优先复用开源生态

CAT 用 Concerto/TAO、导学用 GIFT、知识追踪用 pyKT、教育大模型用 InnoSpark/InnoAgent,可将开发重心集中在题库、量规与学科适配等真正创造价值的环节。

把公平性与隐私作为设计约束而非事后补丁

在题库标定阶段做群体差异检验,在反馈生成阶段做多语言/方言稳健性测试,在数据架构阶段落实最小化采集与透明告知——剑桥报告与 F1000 综述均表明,伦理债的偿还成本远高于预防成本。
研究缺口说明:职业教育场景的专门交互式测评研究在本次检索中证据薄弱(仅经师范生技能评价与 OBE 系统间接涉及)[INFO_GAP];国内高校自研系统(除华东师大体系外)的公开技术细节有限,多依赖厂商口径,已在相应条目标注置信度。
 
打赏
 
更多>同类资讯
0相关评论

推荐图文
推荐资讯
点击排行
网站首页  |  关于我们  |  联系方式  |  使用协议  |  版权隐私  |  网站地图  |  排名推广  |  广告服务  |  积分换礼  |  网站留言  |  RSS订阅  |  违规举报  |  皖ICP备20008329号-18
Powered By DESTOON