Abstract
随着人工智能技术的飞速发展,大语言模型在智能评估领域展现出巨大潜力,但现有技术在处理深层语言特征时仍存在局限性。因此,构建一套面向深层语言特征的智能评估系统,有助于提升教育评估的准确性和效率。研究采用多智能体评分模型,通过嵌入四维深层语言特征(语义深度、情感表达、文化融合、逻辑连贯)的示范性语料库进行优化,技术路线遵循“数据准备—智能评分—结果生成—应用验证”的逻辑框架。实验数据为563篇记叙文,包含日常情境测验和规模化考试两类数据集,实验结果表明,融入深层语言特征的模型与专业教师评分的一致性更高,且具有较高的内部一致性和稳定性。通过对比分析两种不同考试情景下大语言模型与教师评分的表现发现:自动化评分模型的设计需充分考量考试的不同性质,对于规模化考试应严格对齐评分标准,而对日常测验则可保留适当评分弹性以激发学生兴趣;在提示词层面融合专家知识可显著提升大语言模型的评分效度,推动人工智能评估从“表层匹配”走向“语义理解”。研究立足深层语言特征的智能评估,在人机协同的全新模式下构建系统化的评估变革路径,为个性化教学反馈的精准实施提供了有力支撑。
| Original language | Chinese (Simplified) |
|---|---|
| Pages (from-to) | 91-100 |
| Journal | 远程教育杂志 |
| Volume | 43 |
| Issue number | 06 |
| DOIs | |
| State | Published - 2025 |
Keywords
- 生成式人工智能
- 大语言模型
- 多智能体评分模型
- 智能评估
- 作文评分
- 示范性语料库
WoS Categories
- G434
- TP18
Cite this
- APA
- Author
- BIBTEX
- Harvard
- Standard
- RIS
- Vancouver