2026暑期研修|语料库研究的智能新范式——记大模型时代的语料库语言学研修班
2026/08/10
外研社2026年暑期全国高等学校外语学科中青年骨干教师高级研修班以“聚焦专业素养,涵育未来教师”为主题,首次全面应用外研社研发的“中国外语教师素养标准”,精心设计8期课程,涵盖育人素养、学科素养、教学素养、测评素养、数字素养、科研素养等不同主题类别。本年度研修班以标准为引领、以数智为驱动、以需求为导向,立足国家战略,紧扣高等外语教育前沿趋势与教师发展切实需求,汇集各主题领域先行者与深耕者,旨在搭建精准化、高阶性的成长平台,帮助外语教师全面提升专业能力、拓宽育人视野,推动高等外语教育高质量发展,共商新时期拔尖外语人才自主培养方案,共绘“十五五”高等外语教育高质量发展蓝图。
8月5—6日,“全国高等学校外语学科中青年骨干教师高级研修班”第八期——大模型时代的语料库语言学研修班在北京成功举办。本期研修班特邀北京外国语大学许家金教授、刘鼎甲副教授和黄鼎博士主讲,来自全国180余所院校的近240位教师齐聚一堂。研修聚焦语料库建设与标注、R语言统计与可视化、人智协同标注、选题挖掘与建模及情感分析等模块,通过专题讲授、案例展示、现场实操、小组研讨与成果汇报,引导参班教师深入理解大模型时代语料库研究方法的演进逻辑,探索人机协同赋能语言研究的新路径。

研修会场
溯本求源:厘清语料库研究范式脉络
许家金教授首先介绍了本次研修提供的语料、工具与文献资源,并指导参班教师完成软件安装与环境配置。许老师指出,生成式人工智能正与语料库语言学深度融合。他阐释了语料库语言学的核心概念,梳理了“经典时代”“后经典时代”与“大模型时代”语料库研究范式的异同,帮助参班教师厘清语料库语言学发展的基本脉络。许老师特别强调,随着大模型的出现,网络语料来源需谨慎甄别,语料库建设必须确保语料的可信度与可追溯性——这一理念为后续所有研修内容奠定了学术立场基础。

北京外国语大学 许家金教授
循法建库:掌握语料采集与标注方法
刘鼎甲副教授从语料库的类型、抽样与代表性出发,系统阐释了建库的核心原则并展示了单语语料库与翻译语料库的不同抽样框架。在实践层面,刘老师演示了文本手动采集、自动爬取、清洗与格式规范化的全流程。刘老师特别提醒,在当前大模型盛行的背景下,网络爬取行为须严格遵守法律法规与伦理规范。

北京外国语大学 刘鼎甲副教授
黄鼎博士围绕语料标注展开系统讲解。她回顾了词性标注、句法标注等经典方法,演示了语义标注工具及质性分析软件的操作流程,并在此基础上重点展示了大模型辅助语料智能标注的进阶路径。黄鼎博士指出,大模型标注在早期现代英语语料的语用标注准确率接近80%以上,对于不够准确的部分进行人工修订,通过人机协同实现效率与深度的平衡。她还讲解了智能标注质量的评估方法,并展示了多模态标注的前沿探索;以“多模态局部语法”框架为例,演示了大模型如何同时分析图像中的视觉元素与文本中的语言元素,为参班教师打开了多模态语料库研究的新视野。

北京外国语大学 黄鼎博士
软件使用:融合经典工具与大模型技术
许家金教授以自建的小型专门语料库为例,使用经典工具AntConc演示了词表、短语表、主题词表的列表功能,以及检索与搭配分析功能,完整呈现了“检索—观察—统计—解读”的全链条分析流程。许老师指出,语料库研究最核心的操作是检索——以特定的检索词为切入点,在语料库中寻找语言使用的规律。他进一步展示了大模型如何与AntConc的分析结果协同——将搭配词表导入大模型,让模型帮助进行语义归类,从而实现从单纯的形式统计到语义功能解读的跨越。
刘鼎甲副教授讲解了R与RStudio的安装与基本操作。他特别指出,R语言作为开源统计工具,具备代码可复用、分析可复现的核心优势,这是确保学术研究可验证性的关键所在。
许家金教授带领参班教师使用R语言完成了对应分析的完整代码运行。参班教师通过上手操作,从“望而生畏”到“成功产出”,实现了技术自信的突破。
选题设计:挖掘、建模与情感分析
黄鼎博士以自己的两个研究选题为例,生动呈现了从灵感初现到完整研究设计的过程。她提出,好的选题除了灵机一动的发现,更来自于跨领域知识的积累、语料分析中的问题意识以及学术交流的思想碰撞。她展示了如何利用线上平台获取自己感兴趣领域的研究动态与文献;如何通过提示词让大模型协助寻找研究空白并生成选题建议等。她特别提醒,大模型生成的选题建议仅仅是提供启发,文献信息必须经过人工核实,而非直接用于研究中。
许家金教授介绍了主题建模相关内容,演示了北外语料库团队开发的BERTopic图形界面工具的使用,让文科教师无需学习编程即可开展基于预训练模型的主题分析。刘鼎甲副教授梳理了情感分析在语言学中的应用框架,介绍了情感词典资源,并展示了基于R语言的情感分析代码。
工具实操:现场演练与助教辅导
本期研修突出“讲练结合、以练促学”,参班教师在专家带领下分步骤实操,练习所学方法,甚至有的参班教师尝试用所学工具分析自己带来的数据。
研修班特别邀请许家金教授团队的郭嘉雯、郝美佳、李鹤林、任卓璇、宋瑛明、孙铭辰、杨宇航、殷俪恺等8位在读硕博研究生担任助教。研修期间,助教团队为参班教师提供全程技术支持与操作指导,及时、耐心地解答各类实操问题,有效保障了研修活动的顺利开展。




工具实操
助教答疑




学以致用:共创语料库研究方案
为内化研修所学,参班教师以小组为单位,围绕“大语言模型辅助的语料库研究”展开研讨与实践。各组结合所学内容与自身研究方向,积极交流、协同共创,形成了各具特色的研究设计方案。安徽工程大学黄鹂鸣老师、中央民族大学王文茹老师、浙江大学蔡颖莹老师、湖北师范大学杨致远老师、中国矿业大学黄莹老师、北京师范大学胡博杨老师、西北农林科技大学蒋云老师、华侨大学张玉琪老师分别代表八个小组进行了精彩汇报。

小组汇报
代表

三位主讲专家充分肯定了各组的创新思路,并从可行性、方法论规范性与创新点提炼等角度逐一给予了针对性完善建议。许家金教授特别指出,好的研究设计应当“源于文献、立足数据、回归理论”:选题须以扎实的文献调研为基础,分析方法须与数据特征匹配,最终结论须能对话或丰富现有理论框架;同时建议教师在选题时优先选择自己熟悉且感兴趣的领域深耕,而非盲目追逐热门话题,“做自己研究的一亩三分地,才能挖得深、出得彩”。
组长与专家合影
优秀学员与专家合影
本次研修班由外研社高等英语教育出版分社副社长段长城主持。

外研社高等英语教育出版分社副社长 段长城
为期两天的研修内容充实,兼具理论深度、实践广度与操作精度。参班教师在专家引领下,在理解语料库研究范式,掌握建库原则与标注技术,熟悉经典方法与R语言统计,学习选题设计路径等层面,逐步完成了从方法认知到研究实践的系统进阶。
2026年暑期外研社“全国高等学校外语学科中青年骨干教师高级研修班”至此顺利落下帷幕。历时近1个月,8期课程,全国1600余位教师参与其中,从教材编写到课堂教学,从测评设计到教育研究,从教学改革创新到语言数据挖掘,研修以标准为引领、以数智为驱动、以需求为导向,完成了对外语教师专业发展的系统赋能。
研修落幕,践行启程。站在“十五五”规划开局之年的新起点上,外研社将继续以服务教师发展为己任,以专业精神回应时代命题,以平台力量凝聚发展合力,持续助力外语教师在育人理念、教学能力、科研素养与数字素养等方面的全面提升,为构建高质量高等外语教育体系、培养拔尖外语人才贡献持久动力。期待每一位参班教师将研修所得融入日常教学与科研实践,以“未来教师”的视野与担当,在人工智能与外语教育深度融合的时代浪潮中,以专业精进回应强国建设的时代召唤,以育人智慧照亮外语教育的崭新未来!
反思日志摘录
从2010年第一次参加外研社的语料库研修班至今,到今年已经是第三次参加,应该算本班的铁杆粉丝。每次都能见到许老师,每次都有不一样的收获。这次是冲着大语言模型来的,紧凑而充实的日程、专家们详细的讲解、提供的大量资源,让我收获远超预期,深感自己的不足,需要长时间消化所学内容。
R语言虽然已有基础,但对可视化与统计模块(ggplot2绘图、对应分析、条件推断树)还比较陌生,这次学习将其嵌入语料标注结果的后置分析中,配合大模型辅助的多维度标注,则打开了全新的分析维度。大模型辅助智能标注给我的触动最为强烈。以往手工标注耗时长、一致性问题突出,而研修中展示的提示工程方法使大模型能够初步完成语义、功能乃至多模态标注,这帮助我在后续的研究中尝试“预标注+人工复核”的流程。合理运用大模型辅助文献梳理也能极大提高科研效率。小组讨论中,我从技术水平高的老师那里汲取了不少营养。汇报中各个小组利用大语言模型和语料库设计的涵盖翻译学、话语分析、二语习得等领域的研究也颇具启发性。
研修中反复强调的“人机协同”理念让我意识到,研究者的核心价值在于与模型互动中提炼真问题、设计合理标注方案并批判性解读结果,这对我未来选题和教学都将产生深远影响。接下来一个月,我计划复现研修中的实操任务以巩固流程,同时将研修期间获得的选题灵感整理成研究计划。技术会不断迭代,但经过这次研修,我更确信扎实的语料库素养、清晰的问题意识以及人机协同中的批判性判断力,才是自己真正需要持续锤炼的核心能力。
感谢外研社和各位专家的精心设计,我会将此次学习的每一处启发转化为实际研究中的行动力,不断在实践中检验和反思!
——刘老师 武汉纺织大学
第二天的课程内容非常密集,从R语言的数据可视化与统计分析,到大模型辅助语料标注,再到小组成果展示和资源介绍,每一个模块都让我有实实在在的收获。
首先,上午的R语言实操部分让我对数据可视化有了突破性的认识…老师反复强调“数据格式对了,图就出来了一半”,这句话对我触动很大。课上一个案例一个案例地过,从散点图到箱线图再到折线图,虽然节奏很快,但每个步骤都跟下来了,最后看到自己电脑上生成了和老师一样的图形时,确实有一种说不出的踏实感…
其次,大模型辅助语料标注的环节让我眼前一亮…课上演示了如何利用大模型对文本进行语义标注、功能标注,甚至多模态标注。虽然我知道大模型标注目前还不能完全替代人工,但它至少可以作为一个高效的“预标注”工具,先把粗活干了,人再去精调和核对。这样一来,标注的效率就能提升不少,而且大模型在处理大规模语料时的一致性可能比人工更好。这对我后续打算做的大规模语料标注工作是一个很重要的启发。
再次,下午的小组成果展示和专家点评环节是我认为第二天最“值”的部分…许家金教授、刘鼎甲副教授和黄鼎博士逐一点评——可行性怎么样、方法论上有没有漏洞、创新点够不够突出。老师们点评非常直接,好的地方肯定,有问题的地方也毫不含糊地指出来。听别人的方案被点评,其实比自己闷头想管用得多,因为很多坑可能自己也会踩到,提前听到就能避开。
最后,课程尾声的资源介绍也很有价值。老师把常用语料库、大语言模型接口、提示工程资源等系统地过了一遍。这些资源我之前零零碎碎了解过一些,但没有一个完整的体系,这次相当于有了一张“地图”,回去之后知道该从哪里入手、该用什么工具。
——宋老师 湖北文理学院
两天的培训下来,最大的感觉是:不虚此行!这个“不虚此行”体现在很多方面。首先,个人研究和教学方面,这次的研修为我打开了一扇窗。我这些年一直做的教师发展和语言评价研究,经常需要给数据编码,今天发现老师们讲的一些工具包括大模型也可以用来分析质性数据,很开心!另外,我也在思考是不是也可以用语料库的方法来研究自己的领域。另外,我个人一直对英汉对比比较感兴趣,也一直想借助语料库来解决教学上碰到的问题以及帮助学生学习,经常因为不懂语料库而作罢。这两天的学习帮我补上了这一课,虽然很多东西还是一知半解,但我决定回去继续学习,并把之前自己感兴趣的话题再拾起来。其次,老师们的学识之渊博与人格之魅力,着实令我印象深刻。三位老师真是学术上的大牛,学术造诣之深令人佩服,这一定是常年寒窗苦读的结果。不仅在学术上,老师们的人品及个人修养也是我学习的榜样。许老师团队不仅自己研究做得好,还有一种“兼济天下”的学者情怀。研修班发放了那么大的学术资料包,是我参加所有研修中的第一次,许老师20多年坚持维护“语料天涯”,把自己研发及其它相关的语料库资源包括现在的大模型无私地共享给所有人,这种情怀和胸怀着实令人感动。感谢许老师和他的团队,自己没有任何理由不好好做研究。最后,我也想借此机会表达对助教们的感谢。许老师的博士生们特别给力,能够随时帮老师们解决学习和操作中遇到的问题,为他们的耐心和友善点赞!最后也感谢主办方外研社提供的学习机会!
——倪老师 菏泽学院
带着“大模型究竟如何全过程运用到科研中”以及“语料库语言学究竟如何真正与大模型相结合”的问题来参加研修班。第二天的课程通过借助R的各种多变量分析,机器学习方法BERTopic,以及情感分析,提示词工程制作稳定可复现且高效的科研工作流,很好地解决了我的疑惑。同时,许老师,刘老师,黄老师展示的团队案例让我更加深刻地意识到工具是辅助角色,它会不断迭代更新,人人可学可用。因此,在浩大的科技和信息浪潮中,抓大放小,回归到文献和理论,做出好的选题,好的实证设计,为语言现象和语言理论提供创新,可能是更具备挑战性的任务。特别感谢北外语料库团队把繁复的工具制作成simple版本无偿分享,也感谢许老师维护的语料天涯网站。种种都让人特别感动和受益,感受到科研社区的本真!
——蔡老师 浙江大学