
即时发货
7天售后
在线客服
LLM训练数据包(教学类)
5.0(0 条评价)
101 已售
35043 浏览
US$39,999.00US$39,999.00-0%
库存:货源充足
小计:US$39,999.00
总计:US$39,999.00
商品详情
产品概述
本商品为教育教学领域 AI 大模型训练数据包,涵盖 K-12 全学段 + 高等教育多学科内容,包含高质量的教学对话、辅导推理链、考试题库、课程知识图谱及教学策略标注数据。可直接用于 LLM 微调(SFT)、RLHF 偏好对齐及教育场景 RAG 系统构建。
- 数据总量:约 1,500万+ 条高质量教学数据(含对话、QA、推理链)
- Token 规模:约 95亿 Tokens
- 学段覆盖:小学 → 初中 → 高中 → 大学本科 → 研究生/专业考试
- 学科覆盖:数学、物理、化学、生物、语文/英语、历史、地理、计算机科学等 15+ 学科
- 数据格式:JSONL / Parquet(含结构化字段标注)
- 质量标准:教学法(Pedagogy)标注、难度分级、知识点映射、去重与Benchmark污染检测
数据类型与内容
| 序号 | 数据类型 | 详细说明 | 数据量级 |
|---|---|---|---|
| 1 | 辅导对话数据 | 师生多轮辅导对话(苏格拉底式引导、错误诊断、逐步提示),标注教学法意图(11类:提问引导、错误纠正、知识回顾、鼓励、概念解释等) | ~350万轮 |
| 2 | 题库与解析 | 覆盖K-12及大学各学科的结构化考试题库,含详细解析过程、知识点标签、难度分级 | ~400万题 |
| 3 | 知识点推理链 | 从概念定义→性质→例题→应用→易错点的完整知识链路,支持自适应学习路径生成 | ~200万条 |
| 4 | 教案与课程设计 | 标准化教案、教学目标、重难点分析、课堂活动设计、评估标准 | ~80万份 |
| 5 | 学生错误模式数据 | 常见学生错误类型、错误原因分析、针对性纠正策略,用于训练AI诊断学生薄弱环节 | ~180万条 |
| 6 | 自适应提示序列 | 从粗到细的多层级提示(Hint)序列,训练AI在不直接给出答案的情况下引导学生思考 | ~150万组 |
| 7 | 多语言教学数据 | 中文/英文双语对照教学内容,支持多语言教育AI训练 | ~140万条 |
数据特点与质量保障
- 教学法意图标注(Pedagogical Intent):参考ACL 2025最新研究,对每轮辅导对话标注细粒度教学法意图(11类标签),让模型学会“怎么教”而不只是“给答案”
- 苏格拉底式引导标注:专门标注引导式教学片段,训练模型通过提问而非直接告知来引导学生发现答案
- 知识点图谱映射:每条数据关联具体知识点(KP),支持按知识点检索和自适应推荐
- 难度分级系统:认知层级标注(记忆→理解→应用→分析→评价→创造,参考Bloom’s Taxonomy)
- 学段精确标注:每条数据标注适用学段(小学1-6年级 / 初中7-9 / 高中10-12 / 大学本科 / 研究生)
- Benchmark 去污染:已过滤 TutorBench、KMP-Bench 等教育评测集数据
- 多轮去重:精确 → 模糊 → 语义三层去重管线,确保数据多样性
兼容主流教育AI评测
- TutorBench(ICLR 2026):1,490道专家标注教育辅导样本,测试自适应解释、可操作反馈、提示生成
- KMP-Bench:K-8数学教学法评测,含对话和技能两个模块
- MathDial:数学辅导对话评测基准
- MMLU / ARC:通用知识评测中的各学科子集
适用场景
- AI 辅导系统:训练可进行多轮苏格拉底式引导的智能辅导AI(参考 Khan Academy / Khanmigo 方法论)
- 自适应学习平台:基于知识点图谱的个性化学习路径推荐和智能出题
- 自动出题与评分:生成各难度、各学科的高质量试题并提供详细评分标准
- 教师辅助工具:自动生成教案、课程设计、差异化教学建议
- 学情诊断系统:基于学生错误模式数据训练的薄弱环节诊断和个性化补习方案
- 教育研究:教学法效果分析、学习行为模式研究
交付说明
- 数据文件:JSONL / Parquet(以约定为准),附 README 文档和字段说明
- 交付时效:通常 3-7 个工作日,取决于排期与定制需求
- 数据更新:可按需提供后续增量数据更新服务(新课标/新教材适配)
- 合规说明:不包含学生个人隐私数据;如有特殊合规需求(如COPPA/FERPA)请下单前沟通
用户评价
5.0(0 条评价)
暂无评价,购买后成为第一个评价的人吧!
平台保障
- 正品保障,所有商品均为正规渠道
- 自动发货商品付款后即时发送
- 7天售后保障服务
- 24小时在线客服