国内首份《高考志愿AI测评基准》报告发布,由友松实验室独立完成,以千问高考志愿填报Agent为对象。结果显示,千问在稳定性、精确性、结构化表达与效率上已达人类咨询师水平。该研究体现AI在教育决策场景的评估进展。
谷歌研究团队推出Vantage方法,利用大语言模型模拟真实团队互动,旨在测量传统测试难以评估的协作、创造力和批判性思维等“持久技能”,弥补教育领域长期缺乏有效评估工具的不足。
节日季来临,AI玩具和泰迪熊成为热门礼物,但专家提醒家长谨慎购买。剑桥大学研究员指出,AI玩具对儿童长期发展的影响尚不明确,需更多研究评估潜在风险。建议家长在选购时优先考虑安全性和教育性。
Grammarly推出AI写作助手,专为学生和教育工作者设计,提供论文评估、引用生成和抄袭检查等功能。新工具集成在AI原生写作平台中,免费版和Pro版用户均可使用,无需额外付费。教育负责人Jenny Maxwell表示,这些工具旨在帮助学生提升写作能力。
数据驱动的作业评估系统,服务于教育工作者和学生
人工智能驱动的测验生成器,简化教育工作者的评估创建
AI教育工具目录,包括评估、教学、数据分析和专业发展等方面的工具。
Google
$0.7
Input tokens/M
$2.8
Output tokens/M
1k
Context Length
Bytedance
$1.2
$3.6
4
Alibaba
-
Baidu
32
Tencent
Iflytek
$2
Xai
$21
$105
256
$0.5
128
$140
$280
Huawei
Chatglm
Stepfun
Ayush472
基于T5-base微调的技术多项选择题生成模型,专门用于根据技术上下文和正确答案生成相关的问题,适用于教育内容和评估的创建。
tokyotech-llm
用于评估日语网页教育价值的fastText分类器,包含基于维基百科和LLM生成的两种分类器
agentlans
这是一个基于DeBERTa V3架构微调的可读性评估模型,专门用于评估英文文本的阅读难度等级。模型能够根据文本特征预测理解该文本所需的美国教育年级水平,数值越高表示文本越复杂难读。
HuggingFaceTB
基于bigcode/starencoder微调的教育价值代码分类器,用于评估SQL代码文件的教育质量
kenhktsui
基于FastText的轻量级分类器,用于评估网页内容的教育价值,优化CPU处理速度
HuggingFaceFW
基于FineWeb数据集训练的网页教育价值评估分类器,用于筛选优质教育内容
MerlynMind
120亿参数的教育领域安全评估模型,专为课堂环境设计的内容适宜性判断工具
Gauntlet-Incept是一个为K-8学生生成高质量教育内容的系统,专注于文章和题库的个性化生成与评估。