ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Investigation of the Inter-Rater Reliability between Large Language Models and Human Raters in Qu...

2026/8/26 17:22:57 拓冰建站 浏览量
Investigation of the Inter-Rater Reliability between Large Language Models and Human Raters in Qu... 文章总结与翻译一、文章主要内容该研究聚焦大型语言模型(LLMs)与人类评分者在定性分析中的评分者间信度(IRR),旨在解决定性分析因耗时、依赖人工而难以规模化的问题,探索LLMs在物理教育领域定性分析中的应用潜力。1. 研究背景与目标背景:定性研究(QLR)在物理教育中对理解学生思维过程和问题解决方法至关重要,但存在人工编码耗时久、难以规模化的局限,且需多名人类评分者保证信度;现有LLMs用于定性编码的研究未涉及超参数优化,部分研究虽关注提示工程对IRR的影响,但未聚焦工程设计(ED)项目情境。目标:一是对比GPT-4.5和GPT-4o两款先进LLMs与专家人类评分者,在对学生ED项目小组讨论音频转录文本编码时的IRR,并比较两款模型性能;二是探究通过提示工程和OpenAI API优化模型超参数,能否提升LLMs的IRR。2. 研究方法数据来源:选取美国中西部某大学基于微积分的本科物理实验室课程中14个学生小组(每组3人)的音频数据,这些小组在课程第8-14周完成ED项目,第14周末录制至少5分钟关于ED项目中物理和数学概念应用及问题解决方法演变的自由讨论,数据经匿名处理。编码框架:依据已有研究框架,确定4种思维方式作为编码主题,分别是工程设计(ED)、物理概念(PC)、数学结构(MC)和元认知思维(M