公司动态

小红书2020校招数据分析笔试题解析:业务分析、SQL与统计考点全复盘

📅 2026/8/31 1:48:32
小红书2020校招数据分析笔试题解析:业务分析、SQL与统计考点全复盘
1. 这套卷子到底在考什么拆解考核模型与题型分布先说说我拿到这份“小红书2020校招数据分析笔试题卷二”的第一反应它和我之前刷过的不少大厂数分笔试题相比不算偏难怪但很能体现内容社区类业务对应届生的核心诉求。整套卷子如果给一个概括性的定性就是“业务分析为主、工具能力为辅、统计功底兜底”它不是单纯在考你会不会写SQL也不是在考你背没背过概率公式而是在模拟一个数据分析师入职之后每天都会面对的真实工作场景给你一个业务现象让你用数据把它解释清楚再给出可落地的动作建议。从题型结构上看这类卷子通常由三块组成。第一块是业务分析题分值占比最高往往给出一个社区产品的业务场景比如“某段时间内容点击率下降”“用户发布量出现波动”“新用户次日留存偏低”让你判断原因、拆解指标体系、设计分析思路第二块是SQL取数题常见的考点包括留存计算、漏斗转化、连续活跃、同环比计算、去重统计这类在实际工作中出现频率极高的取数逻辑第三块是统计与概率题包括假设检验、AB实验设计、常见的概率计算用来评估你是否具备做科学决策的基本素养。了解这一点之后备考逻辑就很清晰了工具技能是基础门槛统计知识是区分线真正决定你能不能拿到下一面资格的是业务分析题里体现出来的分析框架感。很多同学刷题的时候容易陷入一个误区花大量时间背SQL各种冷门语法或者啃概率论的复杂公式但拿到业务题就不知道从哪里下手写出来的答案像记流水账没有逻辑层次。这套卷子的价值恰恰在于提醒你面试官想看到的不是一个只会取数的工具人而是一个能和数据对话、能和业务同事并肩作战的分析师。2. 业务分析题是重头戏一套可复用的分析框架2.1 拿到一道业务题先别急着写先把问题定义清楚小红书这类内容社区的业务分析题通常会围绕内容生态、用户增长、社区活跃、商业化这几个方向出题。题目大多给一个很简短的背景描述然后让你分析原因或者提出方案。我见过很多同学拿到题就开始列各种可能的因素这个也写一点那个也写一点看起来很全面其实没有重点。这里最关键的一步是先定义清楚你分析的对象和边界。举一个典型的例子题目说“近一个月平台的内容互动率下降了请分析可能的原因”。如果你不上来就罗列原因而是先拆解互动率的定义你会发现这个指标本身就可以有多种口径——互动是点赞、评论、收藏、转发的什么加权组合评论的权重和点赞一样吗分母是曝光量还是阅读量是整体互动率还是人均互动率这些口径不同分析的方向也完全不同。把口径定义清楚不仅让阅卷人觉得你严谨更重要的是它能帮你聚焦分析范围避免写出一堆无关因素。然后需要明确的是业务背景和产品阶段。同一个“互动率下降”在不同阶段的产品上原因分析的侧重点完全不同一个是刚经历过大规模拉新、新用户占比提高的产品互动率下降可能只是因为新用户还未形成互动习惯属于结构性变化而一个已经进入成熟期的产品互动率下降则更可能是内容供给质量、推荐策略、社区氛围等方面出了问题。所以拿到题的第一步不是分析而是补充业务上下文——哪怕题目没给你也要主动设定一个合理的背景然后基于这个背景展开分析。这种“先定义问题再动手”的习惯能让你和只会堆因素的同学迅速拉开差距。2.2 指标体系与维度拆解不是罗列指标而是建立树状结构定义好问题之后就进入核心环节拆解指标体系。很多同学在这里会犯一个典型的错误——把所有相关指标全都列出来曝光量、点击率、完播率、点赞数、评论数、分享数、收藏数、停留时长、跳出率写得满满当当感觉非常专业但面试官看完完全抓不住重点。正确的做法是建立一颗指标树。还是以上面的互动率下降为例我的拆解逻辑是先看分子和分母——是互动总量下降了还是曝光总量上升了又或者是两者同时发生了变化这种拆法听起来很简单但实际工作中90%的初步分析都在做这件事。通过分子分母的对比你能快速定位问题出在用户侧还是内容侧。假设定位结果是互动总量下降那么下一步再拆是互动人数变少了还是人均互动次数变少了是点赞变少了还是评论变少了每一种拆分都对应着不同的业务含义和下一步排查方向。从维度上看核心的拆解维度包括五个层面时间维度日/周/月同比环比用户维度新用户/老用户不同注册时长、不同活跃频次内容维度不同内容类型、不同作者等级、不同内容生命周期渠道维度推荐流量/关注流量/搜索流量设备与版本维度不同操作系统、不同APP版本。这五个维度并不是每次都要全部用上而应该根据问题定义阶段圈定的范围来选择。比如你判断这个问题更可能出在新用户身上那就把用户维度拆细其他维度粗看即可。我自己的习惯是画一个简单的树状图一个问题现象放在最上面然后是贡献层再往下是原因层最后是验证层。笔试的时候虽然不需要真的画图但在草稿纸上用这种方式把思路理清写出来的答案结构会更清晰。阅卷人看答案的速度很快一个逻辑清楚的分层结构远胜一个看起来什么都提到了却没有主线的平铺陈述。2.3 归因分析如何从“可能原因”收敛到“核心原因”维度拆解能帮我们定位到问题出在哪个子群但还没法回答“为什么”——这时候就需要做归因分析。归因分析的本质是提出假设并用数据验证而不是凭空猜测。继续用互动率下降的例子。假设我们通过拆解发现下降主要来自新用户群体那么接下来就要问为什么新用户的互动率下降了可能的假设包括新用户推荐流里的内容调性和他们不匹配新用户还没来得及建立社交关系链刷到的都是陌生人内容互动意愿低新用户注册流程或阅读页在某些机型上有体验问题导致互动入口点击困难新用户群体本身发生了结构性变化比如最近投放的渠道换了一批更泛的人群。提出假设之后每一个假设都需要数据验证的思路。比如假设是推荐流内容匹配问题可以对比新用户在不同内容类型上的互动率看是否有明显偏低的内容品类假设是社交关系链问题可以对比新用户中有无关注行为的群体和没有关注行为的群体之间的互动率差异假设是体验问题可以按机型版本维度看互动率的分布差异。分析思路到这里其实已经形成了一个完整的闭环从现象出发定义口径进行拆解锁定子群提出假设设计验证方案。这套闭环在笔试中写出来就是一次很扎实的数据分析。还有一个细节需要特别强调归因分析要区分相关性和因果性。很多同学在笔试里写“新用户的互动率低所以我们要提升新用户互动率”这等于没说。正确的做法是找到可落地的抓手比如“新用户中关注了头部作者的群体互动率显著高于未关注群体因此可以通过冷启动阶段的关注引导来提升新用户互动率”。有对比、有差异、有动作这才是一个有说服力的归因结论。笔试阅卷人通常不太指望你在这个环节给出百分之百正确的答案他们更在意的是分析逻辑是否严谨、结论是否建立在数据对比之上。2.4 AB实验设计笔试中的实验题重点考察这几件事归因分析之后一般紧跟着就是策略验证笔试里最常见的出题形式是让你设计一个AB实验来验证某个策略是否有效。这类题目看上去独立其实是业务分析题的延续——它考察的是你有没有“用实验做科学决策”的意识。一个完整的AB实验设计通常要交代清楚以下几件事实验指标包括核心指标和护栏指标、实验单元、样本量与分流方式、实验周期、显著性水平与统计功效、可能存在的偏差及应对措施。举例来说如果要验证“优化推荐流中短视频占比能否提升新用户互动率”那么核心指标可以定为新用户人均互动次数辅助指标可以看新用户次日留存率是否受到影响护栏指标则包括内容举报率、差评反馈率、卸载率这些需要监测防止策略端出问题的指标。这里我发现很多同学的答案会漏掉两个方面。第一是只盯着核心指标看忽略护栏指标比如一个新策略把互动率做上去了但是同时让用户体验明显变差、卸载率飙升那么从长期看这个策略可能是不值得上线的笔试里写出护栏指标能体现你的全局观。第二是样本量和实验周期几乎不提但这恰恰是面试官很看重的一个细节——如果样本量太小实验跑不出显著差异统计功效不足结论等于白做如果实验周期太短观察不到新奇效应消退后的真实表现得出的是一个虚高或者虚低的结果。新用户在刚接触一个新策略时往往会因为新鲜感而产生短暂的行为变化这种新奇效应需要在实验设计时预留足够的时间来排除。我在复盘这套卷子的时候有种强烈的感受实验设计题其实是整个卷子里最容易拿分的题因为它有明确的得分点。只要把“选什么指标、怎么分流、跑多久、怎么判断结果、有没有风险”这五件事讲清楚哪怕答案不是最完美的也能拿到大部分分数。反而是在业务分析题里很多同学因为内容多、方向多容易写得散乱而失分。3. SQL与统计题的“题眼”在哪里高频考法与易错点复盘3.1 SQL高频考点留存、漏斗、连续活跃与常见的坑数据分析笔试中的SQL题一般不会故意刁难你写特别复杂的递归查询或者冷门的高级语法高频考点非常集中就那几类留存率计算、漏斗转化、连续活跃、分组排名、同环比计算。这些场景对应着业务同学最常问到的取数需求比如“帮我算一下用户次日留存”“看下从曝光到购买的转化漏斗”“找出连续打卡7天的用户”。如果你能把这几类题练到闭着眼睛都能写出来的程度SQL部分基本就稳了。以最经典的留存计算为例它的核心逻辑是“先定义初始行为再观察后续行为”。题目往往会给你一张用户行为日志表字段包括用户ID、日期、行为类型等让你计算某天的次日留存率。很多人第一次写的时候会卡在“同一个用户在次日可能有多条行为记录”这个细节上导致计算出来的留存人数虚高。正确做法是先对第二天有回访行为的用户做去重再和初日活跃用户集合做关联得到留存人数除以初日活跃人数得到留存率。这个“先圈定目标用户集合再关联观察集合”的思路几乎贯穿所有留存类SQL题。漏斗分析的常见坑在步骤顺序和去重粒度。比如分析从曝光到点击再到收藏的转化漏斗必须保证每一步去重的维度一致要么都按用户去重要么都按会话ID去重混用口径出来的漏斗会非常奇怪。还有一点容易被忽略漏斗的每一步之间要限定时间窗口比如“曝光后24小时内的点击”才计入漏斗否则跨天行为会把漏斗率算得虚高。笔试中给出的表结构和时间戳字段往往就是考察你有没有这个意识。3.2 窗口函数的掌握程度直接影响你的SQL水平评级在笔试批改SQL题的时候我猜测阅卷人会特别关注一个点你习惯用朴素的多表关联和子查询硬算还是会自然地使用窗口函数。窗口函数在笔试中的价值不仅仅在于简化写法更在于它能解决很多自连接难以优雅处理的场景比如分组内排名、同环比计算、累计求和、相邻时间差等。举个例子连续活跃问题是笔试常客给定用户登录表找出连续登录3天及以上的用户。用窗口函数的思路可以先按用户分组、按日期排序用row_number()生成每个用户登录日期的序号然后用登录日期减去序号得到一个日期值。如果用户连续登录这个日期值保持不变那么我们只需要按用户和这个日期值分组统计组内天数就能筛选出连续登录3天及以上的用户。这个解法的精妙之处在于它把“连续性判断”转化成了“差值分组”逻辑一下子就清晰了而且不管是连续3天还是连续7天解法完全通用。同环比计算是另一个窗口函数的典型应用场景。lag()函数可以让当前行访问前一行甚至前N行的值这样计算日环比、周同比就非常直接不需要反复自连接一张表。笔试中如果碰到“计算最近30天每天的日活环比增长率”这类题目用lag()就是最优解代码短、逻辑清晰、不容易出错。当然窗口函数也不是银弹比如窗口过大导致性能问题、partition by的粒度选错导致计算结果不符合预期这些都是常见的坑。我的建议是专项练习窗口函数时把排序函数row_number、rank、dense_rank、偏移函数lag、lead、聚合窗口函数sum over、avg over这三类吃透笔试SQL题基本就不会再成为绊脚石。3.3 统计题不要只背公式要能讲清楚统计思维统计与概率题在笔试题里通常占20%到30%的分值。常见的题型包括给出一个业务场景让判断该用什么检验方法给定数据和显著性水平让判断结果是否显著给一个概率问题让算条件概率或者直接问AB实验相关的统计知识。我发现很多同学在备考统计题时容易走两个极端一种是把概率论教材从头背到尾各种公式张口就来但一到应用题就卡壳不知道用哪个公式另一种是觉得统计题分值不高直接战略性放弃把精力全放在SQL和业务题上。这两种做法在笔试中都不太划算。统计题虽然不是卷面占比最大的部分但它是面试官判断你“有没有科学决策素养”的重要依据——同样的AB实验结果有统计基础的人能判断出“差异不显著需要扩大样本量继续观察”没有统计基础的人可能会直接喊“策略有效全量上线”。这种判断力正是数据分析岗位的核心价值之一。针对笔试里的统计题我的备考建议是优先掌握假设检验的完整逻辑链条包括原假设与备择假设的设定、显著性水平的含义、p值怎么理解、第一类错误和第二类错误的区别、统计功效受哪些因素影响。不要死记硬背公式推导而是把每个概念放到业务场景里理解——比如“显著性水平0.05”的意思其实是即使策略真的没有效果我们也有5%的概率错误地得出策略有效的结论这个错误概率能不能接受取决于业务风险的大小。能用这种“业务语言”把统计概念讲清楚的人笔试短文题往往能拿高分。概率题部分重点复习条件概率、贝叶斯公式和常见分布比如二项分布、正态分布在实际业务中通常对应什么样的数据形态。有一个很常见的笔试变体是用“一个检测准确率是99%的模型在发生率只有1%的群体中如果检测结果阳性这个人真正患病的概率是多少”来考查贝叶斯思维的。这类题目考的不是复杂计算而是你能不能意识到基础发生率对后验概率的巨大影响——数据分析中任何一个结论脱离了先验背景来做判断都容易得出偏差很大的误导性结论。4. 复盘这套卷子暴露出来的能力短板那些丢分点与涨分点做完一套笔试题比分数更重要的事情是复盘。我对照这套卷子的出题方向复盘了当年我在准备校招笔试时踩过的坑和后来帮别人辅导时见过的共性问题集中写几个典型的丢分点这些也是大多数应届生在同类笔试中最容易失分的地方。第一个丢分点是“有分析无结论”。业务分析题里很多人写了一大堆维度拆解和可能原因看到最后没有一句明确的判断。面试官在快速阅卷时最想看到的是“基于以上分析问题主要出在XX方面建议优先验证XX假设”而不是把所有可能性ABCDE摆在那里让面试官自己替你总结。数据分析工作的本质是辅助决策如果你的输出不能收敛为一个可行动的建议那么在面试官的眼里你的分析能力就是打折扣的。第二个丢分点是“指标口径不经交代就使用”。同样一个留存率有人按用户维度算有人按设备维度算有人按账号维度算算出来的数字可能差好几个百分点。笔试中把口径交代清楚既是专业性的体现也能让后续的分析建立在扎实的基础上。还有的同学在计算漏斗时每一步去重粒度不一致导致漏斗每一层的基数逻辑混乱这就是基本功不扎实的表现。第三个丢分点是“实验设计忽略了样本量和实验周期”。我前面反复强调这一点因为它实在是太常被忽略了。面试官一旦在实验设计题里看到你连样本量估算和实验周期都不提基本就能判断你对AB实验的理解停留在“把用户随机分成两组对比一下指标”的表层认知上。第四个丢分点是“时间分配不合理”。这套卷子的题量并不算少如果在一道业务分析题上洋洋洒洒写了两千字后面SQL和统计题大概率时间不够用。我的建议是拿到卷子先花两分钟扫一遍所有题目按分值占比分配时间业务分析题写字速度再快也不要超过整体时间的三分之一SQL题优先写结构清晰的正确解法统计题如果卡住超过5分钟就先跳过最后再回头想。数据分析的笔试不只是考知识也考你在限定资源下做优先级判断的能力。涨分点也很明确总结起来就几句话结构化表达比堆砌内容更重要假设验证的闭环比罗列因素更重要统计与实验的严谨意识比算对某一个数字更重要把结论写成可行动的业务建议比展示高深的技术技巧更重要。这些东西不是背几套题就能速成的但在备考阶段有意识地往这个方向打磨你会发现卷面上的每一道题其实都是在给你机会展示自己“像一个真正的数据分析师那样思考”。5. 从笔试到面试这套卷子给后续备考带来的几点具体启示笔试只是校招的第一道关卡但它的信号价值很大——笔试成绩往往决定了面试官对你的初始预期也直接影响面试前期的提问走向。如果你在笔试中业务分析题表现出色面试官大概率会在面试环节针对业务分析继续深挖试图验证你笔试里的思路是真本事还是临时拼凑的如果你SQL满分但业务题很弱面试官则会把重心放在考察你的业务敏感度上。所以备考不能止步于“做完一套卷子对一下答案”而是要顺着卷子暴露出的薄弱环节把知识体系补完整。从这套卷子的内容来看我建议备考的同学按照三个层次来安排后续学习计划。第一层是工具能力的熟练化SQL窗口函数、Python的pandas和numpy、Excel的数据透视表和常用函数这些基础工具要做到不假思索就能用第二层是业务分析框架的内化包括指标体系的搭建、维度拆解方法、归因分析逻辑和AB实验设计模板这一层需要结合真实案例反复练习形成肌肉记忆第三层是业务理解深度的拓展特别是如果你目标平台是内容社区类产品一定要去理解内容分发机制——推荐、关注、搜索三种流量各自的特点内容供给与消费的平衡创作者激励机制社区氛围和治理对数据指标的影响。数据分析师如果只懂数据不懂业务很多分析会浮于表面写不出有洞察的结论。关于复习资料笔试阶段其实不需要贪多把近两三年的校招真题吃透比漫无目的地刷一百道题库更有效。遇到每一道题不要只看参考答案要追问自己这道题在考哪个能力如果我写的答案被面试官追问我能不能把每一个分析步骤背后的逻辑说清楚用这种“以面代笔”的心态来准备笔试效率會高很多。最后也是最重要的一点数据分析能力不是靠刷题刷出来的是靠持续用真实数据解决真实问题长出来的。如果时间允许不妨找一份公开数据集或者参加一些数据分析项目完完整整地走一遍“业务问题定义、数据获取与清洗、探索性分析、建模分析、结论落地”的全流程哪怕项目很小也比只做模拟题要更能锻炼实战思路。校招考察的不是你会多少招而是你有没有形成一个稳定的分析闭环以及遇到新问题时知不知道该怎么拆解。这套卷子只是一个入口后面的路还长把基本功打得扎实一些面试场上你会从容很多。