公司动态

在线教育平台的题目推荐算法:知识追踪与自适应学习

📅 2026/7/25 9:48:59
在线教育平台的题目推荐算法:知识追踪与自适应学习
在线教育平台的题目推荐算法知识追踪与自适应学习一、深度引言与场景痛点为什么刷完 100 题正确率还是 60%很多在线教育平台的题目推荐是在随机排列——今天推 3 道数组题明天推 3 道链表题。这种方式假设用户对每类知识点的掌握程度是均匀的但实际情况远非如此。教育学中的知识追踪Knowledge Tracing回答了这个问题一个学生做对/做错一道题背后反映的是他对特定知识点的掌握状态。通过追踪学生和知识点之间的交互历史可以推断出他对每个知识点的掌握概率然后据此推荐刚好在他最近发展区的题目。二、底层机制与原理深度剖析贝叶斯知识追踪BKTBKT 的核心参数每个知识点有 4 个参数P(L₀)初始掌握概率学生在学习前的掌握概率P(T)学习概率做一题后从不掌握变为掌握的概率P(G)猜测概率不掌握但答对的概率P(S)失误概率掌握了但答错的概率三、生产级代码实现与最佳实践# 贝叶斯知识追踪BKT实现 import numpy as np class BayesianKnowledgeTracing: 贝叶斯知识追踪模型 为每个知识点维护一个掌握概率 P(knowledge)。 每次学生做题后根据答题结果更新这个概率。 def __init__(self): # 每个知识点的 BKT 参数 # 实际应用中这些参数需要通过 EM 算法从历史数据中学习 self.params { p_learn: 0.3, # P(T): 学习率 p_guess: 0.15, # P(G): 猜测概率 p_slip: 0.1, # P(S): 失误概率 } # 学生的知识点掌握状态 {student_id: {skill_id: P(knowledge)}} self.student_skills {} def initialize_student(self, student_id: str, p_init: float 0.3): 初始化学生 —— 所有知识点都从未掌握开始 self.student_skills[student_id] {} def get_mastery(self, student_id: str, skill_id: str) - float: 获取学生对某知识点的掌握概率 if student_id not in self.student_skills: self.student_skills[student_id] {} return self.student_skills[student_id].get(skill_id, 0.3) def update(self, student_id: str, skill_ids: list[str], is_correct: bool): 根据答题结果更新掌握概率 这是 BKT 的核心更新逻辑。 Args: student_id: 学生 ID skill_ids: 这道题涉及的知识点列表 is_correct: 学生是否答对 for skill_id in skill_ids: p_knowledge self.get_mastery(student_id, skill_id) if is_correct: # 答对有两种可能 # 1. 掌握了且没有失误: P(know) × (1 - P(S)) # 2. 没掌握但猜对了: (1-P(know)) × P(G) p_correct_given_know (1 - self.params[p_slip]) p_correct_given_not_know self.params[p_guess] # 贝叶斯更新公式 # P(know|correct) # P(correct|know) × P(know) / P(correct) p_correct ( p_knowledge * p_correct_given_know (1 - p_knowledge) * p_correct_given_not_know ) if p_correct 0: p_knowledge ( p_knowledge * p_correct_given_know / p_correct ) else: # 答错也有两种可能 # 1. 没掌握: 1 - P(know) # 2. 掌握了但失误了: P(know) × P(S) p_incorrect_given_know self.params[p_slip] p_incorrect_given_not_know 1 - self.params[p_guess] p_incorrect ( p_knowledge * p_incorrect_given_know (1 - p_knowledge) * p_incorrect_given_not_know ) if p_incorrect 0: p_knowledge ( p_knowledge * p_incorrect_given_know / p_incorrect ) # 学习效应做题后掌握概率会自然上升 p_knowledge p_knowledge (1 - p_knowledge) * self.params[p_learn] self.student_skills[student_id][skill_id] p_knowledge# 自适应题目推荐 class AdaptiveRecommender: 自适应题目推荐器 推荐策略 1. 找出学生掌握概率在 40%-70% 的知识点 2. 为这些知识点选择难度匹配的题目 3. 这就是最近发展区——不太难也不简单正好处于学习区 def __init__(self, bkt_model: BayesianKnowledgeTracing): self.bkt bkt_model # 题目库{problem_id: {difficulty, skills, ...}} self.problems {} def recommend(self, student_id: str, top_n: int 5) - list[dict]: 为学生推荐下一组题目 推荐逻辑 1. 找到处于学习区的知识点P(mastery) ∈ [0.4, 0.7] 2. 优先推荐这些知识点的中等难度题 3. 确保推荐的知识点有多样性不集中在 1-2 个知识点 # 找到处于学习区的知识点 learning_zone_skills [] for skill_id in self._get_student_skills(student_id): mastery self.bkt.get_mastery(student_id, skill_id) if 0.4 mastery 0.7: learning_zone_skills.append((skill_id, mastery)) # 如果没有处于学习区的知识点推荐掌握度最低的几个 if not learning_zone_skills: all_skills self._get_student_skills(student_id) all_skills sorted( all_skills, keylambda s: self.bkt.get_mastery(student_id, s) ) learning_zone_skills [ (s, self.bkt.get_mastery(student_id, s)) for s in all_skills[:5] ] # 从学习区知识点中推荐题目 recommended [] recommended_skills set() # 按掌握概率排序越低越优先 learning_zone_skills.sort(keylambda x: x[1]) for skill_id, mastery in learning_zone_skills: if len(recommended) top_n: break # 找到该知识点的题目 candidates [ p for p_id, p in self.problems.items() if skill_id in p.get(skills, []) and p_id not in [r[id] for r in recommended] ] if not candidates: continue # 根据掌握概率选择合适难度 # mastery 低 → 选简单题mastery 高 → 选难题 if mastery 0.5: candidates.sort(keylambda p: p.get(difficulty, 3)) elif mastery 0.65: candidates.sort(keylambda p: p.get(difficulty, 3)) candidates candidates[len(candidates)//3:] # 中等难度 else: candidates.sort(keylambda p: p.get(difficulty, 3), reverseTrue) selected candidates[0] if candidates else None if selected: recommended.append({ id: selected[id], skill: skill_id, mastery: round(mastery, 2), reason: f当前掌握度 {mastery:.0%}处于学习区 f推荐强化练习 }) recommended_skills.add(skill_id) return recommended def _get_student_skills(self, student_id: str) - list[str]: 获取学生接触过的所有知识点 # 从所有题目中收集知识点 skills set() for problem in self.problems.values(): skills.update(problem.get(skills, [])) return list(skills)四、边界分析与架构权衡BKT vs DKTDeep Knowledge TracingBKT 的优点是简单、可解释——每个参数都有直观的教育学含义。但假设每个知识点独立无法建模知识点之间的迁移学了数组对链表有帮助。深度知识追踪DKT使用 RNN/LSTM 对整个学习序列建模可以自动学习知识点之间的关联。代价是模型变成一个黑盒无法像 BKT 那样给出你在数组上的掌握概率是 65%这样直观的解释。推荐策略教学场景用 BKT需要可解释性难度自适应场景用 DKT需要更高准确度。冷启动问题新学生没有任何答题记录时P(L₀) 默认设为 0.3。这不是随机选择的——大多数学生在学习前的掌握概率确实很低。但这里有一个隐含假设所有学生从同一起点开始。对于有过相关学习经历的学生这个假设可能低估了实际水平。五、总结知识追踪的核心思想是不只看答对了没而是看答对/答错反映了什么。BKT 通过四个概率参数学习、猜测、失误、初始掌握对学生的知识状态进行了概率建模。这给了在线教育平台一个明确的推荐逻辑P(mastery) 40% → 推荐基础讲解简单题P(mastery) 40%-70% → 推荐中等难度练习题学习区P(mastery) 70% → 推进挑战题或下一个知识点这种恰好的挑战是有效学习的关键。对于构建教育产品的工程师来说理解知识追踪不仅是理解一个算法更是理解学习这件事本身的规律。