水保学院骆汉副研究员课题组在大语言模型完成水土保持任务能力研究方面取得新进展

来源:水保工程中心 作者:骆汉 时间:2026-09-08

近日,水保学院骆汉副研究员课题组在大语言模型完成水土保持任务能力研究方面取得新进展。相关研究成果以“Evaluating and advancing large language models for soil and water conservation tasks: Case study of the black soil region”为题,发表在Journal of Cleaner Production (IF=10.697)期刊上。水持与荒漠化整治点实验室为论文第一完成单位,硕士研究生赵浚棋为第一作者,骆汉副研究员为通讯作者。

水土保持领域数十年积累的海量知识高度碎片化,严重制约其高效利用。一方面,大语言模型(LLM)已在医学、法律等专业领域展现出接近专家的知识整合与决策支持能力,为破解上述难题提供了新路径;另一方面,水土保持知识多深嵌于技术规范与非结构化文本,通用语料覆盖不足易诱发幻觉,使其可靠性存疑。然而,LLM 在水土保持任务中的能力边界、以及监督微调(SFT)能否向本领域迁移尚未明确,根源在于该领域长期缺乏专用评测基准。

基于此,本研究以黑土区为案例,按布鲁姆六层认知目标构建了SWC-KC评测框架,涵盖知识问答与工程参数计算两类任务,从权威报告、技术规范及415篇文献中挖掘并经专家审核构建评测与微调数据集,系统测评了8个主流模型,并对2个14B开源模型开展LoRA微调。

研究结果表明,各模型知识任务准确率仅为40%—60%,且同一子任务下呈单选>多选>简答,开放性越强作答越难。计算任务呈强烈的公式依赖:给定公式时推理模型均超69%、DeepSeek-R1高达73.70%,无公式时全部低于17.37%。失败可分解为公式选择失误(38.2%)与公式执行失误(50.5%),二者在题型间几乎完全分化。质量提升代价高昂,推理模型准确率平均提高9.34个百分点,响应时间却增长25倍以上。SFT使知识任务准确率提升超20个百分点、均突破70%;而计算任务改善有限,无公式场景仍低于20%。

研究构建了首个水土保持领域LLM评测框架,揭示了微调“能补知识、难破推理”的能力边界,为模型选型与领域智能化应用提供科学依据。

该研究得到国家重点研发计划(2024YFD1501104)、陕西省自然科学基础研究计划(2025JCYBMS-285)以及杨凌示范区科技计划项目(2024NY-04)的联合资助。

原文链接:https://doi.org/10.1016/j.jclepro.2026.149322

1 大语言模型在知识任务(A)和计算任务(B)中的平均准确率

2  实验因素对模型准确率、响应时间及质量效率指数(QEI)的效应量


图3 DeepSeek-R1-Distill-Qwen-14B与Qwen3-14B在微调前后各任务类型上的准确率提升

编辑:王容娜

终审:李小梅


附件下载: