淘天数据岗笔试复盘:SQL、统计与业务分析备考指南
2026/9/1 12:14:23 网站建设 项目流程

2024年春招,我前后投了不少大厂的数据岗,淘天集团的笔试算是印象最深的一场。倒不是它最难,而是它的考察面特别全,题量也大,一场笔试下来基本能把数据岗的核心技能树扫一遍。我大概是在3月中旬收到的笔试通知,从点击链接那一刻起就进入倒计时状态,整个过程用一个字概括就是“赶”:时间赶、题目赶、心态也赶。

说实话,很多准备校招的同学都在问淘天数据岗笔试到底考什么、怎么准备、有没有什么坑。这个问题我那时候也搜了很久,但网上信息大多零散,要么是“刚考完,攒人品”的碎片帖,要么是机构整理的课程广告。所以这篇我把自己的实际经历、复盘、以及后来回头看觉得最有价值的准备思路完整写出来,给后面要考淘天或者其他大厂数据岗的同学一个参考。

先说结论:淘天数据岗笔试不是那种背背书就能过的考试,它更接近一场高强度的业务分析模拟。SQL是基本功,统计和机器学习是敲门砖,业务思维是真正的分水岭。如果你这三块都比较扎实,那笔试对你来说更像是一次限时热身;如果有一块明显薄弱,短板效应会非常明显,因为题型之间是有联动设计的。下面我按实际笔试的结构,从头到尾拆一遍。

1. 笔试整体流程与时间分配复盘

1.1 笔试形式与硬性门槛

我收到的笔试通知是通过邮件发送的,指向一个线上笔试平台(这类校招笔试一般用牛客网或赛码网,淘天用的我记得是牛客的系统)。整体流程是:提前用电脑登录、做设备检测、拍照验证身份、开始考试。全程有摄像头监控,部分岗位还要求手机扫码做第二机位监考,所以考试环境需要提前收拾好,桌面除了水杯和身份证最好什么都别放。

形式上是分模块计时,不是整份卷子统一倒计时。我记得大概是行测类题一个块、专业题一个块,每个模块单独倒计时,时间到了自动切到下个模块,不能回头改前面的答案。这个设计很要命,因为如果你在某个模块上耗时太多,后面的题目就算会做也没机会了。所以考场上最重要的事情是先搞清每个模块的题量和时长,再决定做题节奏。

1.2 题型分布与分值结构

整体来看,笔试主要包含这几块:行测/逻辑题、数据分析SQL题、统计学/概率论题、机器学习基础题、业务分析题。不同岗位侧重不同,比如数据研发岗SQL占比会更高,数据分析岗业务分析题权重更大,数据科学岗机器学习题会更深入。我当时投的是数据分析方向的岗位,题型占比大致是:逻辑行测20%左右,SQL和取数约30%,统计概率20%,业务分析30%。这个比例不是官方公布的,是我做题时的体感,但参考价值很高,因为准备重点基本能从这里映射出来。

分值分布有个特点:业务分析题虽然占比高,但它是最后出现的,而且往往是大段材料+多个小问,读题本身就很耗时。很多人前面SQL和统计做得太慢,到业务题只剩下十几分钟,只能草草写几行分析思路交卷,这是最可惜的丢分方式。

1.3 时间管理策略:我的教训

我那次笔试整体时间还算勉强够用,但复盘时发现有不少时间浪费在了犹豫上。比如行测题里有一些图形推理和资料分析,个别题目卡了我三四分钟,回头想想非常不划算。正确策略应该是:一道题超过2分钟还没思路,立刻标记跳过,把能拿的分先拿到。专业题中,SQL如果卡壳超过10分钟,也建议先写核心逻辑框架,哪怕不能完整跑通,思路分也可能有一点点,至少能向面试官展现你懂怎么拆解问题。

这里有个小技巧:笔试平台一般支持在线代码编辑,但有些平台的SQL运行环境不是本地数据库,而是预先配置好的在线MySQL/PostgreSQL环境,运行速度快不快取决于平台负载。我建议你提前在牛客网上熟悉一下SQL题的答题界面,尤其是字段名提示和表格预览功能。平时练习是在Navicat或本地MySQL里写的,到了平台上一时找不到“运行”按钮的情况真的会发生,别问我怎么知道的。

2. 核心考点深度拆解:这些题到底在考什么

2.1 SQL题:窗口函数和多表关联是基本盘

淘天的SQL题不是让单纯写个select那么简单,它偏爱的是“业务场景+SQL实现”的组合题。比如给出订单表、用户表、商品表,让你计算每个类目下销售额Top10的商品,或者统计连续3天有购买行为的用户数。这类题考察的是:多表关联、窗口函数(row_number、rank、dense_rank、lag/lead、sum over)、去重逻辑、时间函数处理。

我记忆最深的一道题是让统计“每个用户的首单时间以及首单后的30天内复购率”,这里面要用到min(order_date)窗口函数定位首单时间,再用dateniff判断复购周期,最后做聚合。如果你只会group by和join,遇到这种题会非常吃力。我的建议是:SQL练习题不需要刷特别多,但必须把窗口函数练熟,尤其是partition by和order by的组合逻辑。可以拿LeetCode数据库题库和牛客SQL专项来练,每天3-5题,坚持两周就够应付笔试了。

另外,注意SQL风格问题。平台上判题一般不看你缩进和命名,但有些公司要求最终结果表字段名和题目要求完全一致。提交前多检查一下group by字段、count去重条件,避免因为字段名大小写不一致被判错。我那次就是有个字段名写成了大写,结果运行报错,找半天才发现是个低级问题。

2.2 统计与概率题:A/B测试是高频中的高频

数据岗笔试里统计学很少考纯理论计算,它更偏应用。典型的题目有:给一个A/B测试的结果,两组样本量不同、转化率分别为多少,问你如何判断差异是否显著,并说明依据。这里你需要会算z检验/t检验,知道p值怎么解释,能区分统计显著性和业务显著性。

还有一类是做估算题,就是费米问题。比如“估算杭州市一天能卖出多少杯咖啡”“推测某个电商平台月GMV中退货订单占比”,这种题没有标准答案,考察的是你的逻辑拆解能力:从总人口、目标人群比例、消费频次、均价一层层往下拆。我在准备时练过几道类似题,形成自己的框架之后,遇到新的估算题就能套用。

概率题则会考条件概率、贝叶斯公式、期望值计算。比如已知某商品点击率是1%,推荐算法带来的点击占80%(但整体流量只占10%),问某个点击来自推荐算法的概率是多少——这就是标准的贝叶斯题。复习时把条件概率、全概率公式、贝叶斯公式过一遍,再做十几道例题,这部分的分数基本能稳拿到。

2.3 机器学习基础:不考手推,但考理解

数据分析岗的机器学习题不会让你手推公式,更多是考概念理解、模型适用场景和评估指标。常见题目有:什么是过拟合,如何检测和规避;随机森林和GBDT的区别;如何评估一个二分类模型(混淆矩阵、准确率、召回率、F1、AUC);特征工程里缺失值处理和类别特征编码的方法。

我当时遇到一道题,给出了一个不均衡分类场景(正样本占比不到5%),问你会选择什么评估指标,以及做数据层面的哪些处理。这题其实在考两件事:一是你知道AUC比accuracy更适合不均衡样本,二是你能想到过采样、欠采样、SMOTE、调整分类阈值这些手段。答的时候尽量有层次:先说指标选择,再说数据处理方法,最后补充模型层面策略(如集成学习)。这类题的答题空间较大,踩点给分,多写不扣分,前提是逻辑不乱。

2.4 业务分析题:真正拉开差距的部分

业务分析题通常给你一段业务背景描述,比如“某电商App近一个月的日活跃用户数出现下滑,请分析可能原因并提出一套数据监控方案”。这种题看起来开放,实际有隐含的答题框架:先定义核心指标(DAU、新用户数、老用户回流数、人均使用时长)、然后拆维度(渠道、地区、设备、版本、行为路径)、再排优先级(先看数据是否有异常波动,再看是结构性变化还是外部事件影响)、最后给出监控方案(核心指标+预警阈值+异动归因流程)。

另一个常考的是指标体系设计。比如“为一个直播带货业务设计一套数据指标体系”,你不仅需要列出指标,还要说明指标间的逻辑关系。我当时按“用户生命周期”框架来答:拉新阶段(注册转化率、新客首购率)、留存阶段(次日/7日/30日留存)、活跃阶段(DAU/MAU、人均观看时长、互动率)、转化阶段(下单转化率、客单价、GMV)、传播阶段(分享率、K因子)。这样答出来,即使细节不够深入,整体框架看起来也比较完整,面试官会认为你有体系化思考能力。

3. 考前准备与实战策略:怎么练最有效

3.1 用简历倒推复习范围

准备笔试的第一步不是盲目刷题,而是对着自己的简历画知识地图。什么意思?就是看你简历里写了哪些技能、哪些项目,笔试大概率会围绕这些基础点出题。比如你简历里写了“熟悉SQL和Python”,那SQL题大概率跑不掉;你写了“用过逻辑回归和决策树”,那机器学习的评估指标、模型对比就可能成为考点。淘天的笔试出题人看简历的可能性很大,因为校招简历量大但JD相对清晰,考题要和岗位要求匹配,所以不要指望简历之外的知识帮你拿分,先把简历写过的内容吃透。

我当时给自己列的复习清单是这样的:SQL窗口函数和复杂查询、Python的pandas数据处理、统计学假设检验、A/B测试流程、常见机器学习模型原理和评估、业务指标体系设计方法论。每天按这个清单过2-3个模块,比漫无目的地刷海量帖子高效得多。

3.2 刷题资源与题库选择

SQL方面,首推牛客网的SQL题库,它分入门、进阶、实战三个层级,上面有不少电商类场景题,和淘天的出题风格很接近。LeetCode的数据库题库偏逻辑技巧,有些题目在商业场景中不太常见,但作为锻炼思维也不错。我建议是:牛客为主,LeetCode为辅,每天固定时间做两三道。

统计和机器学习方面,可以看《白话统计》《机器学习西瓜书》的基础章节,但更重要的是做题。推荐刷一些大厂笔试真题的回忆帖,虽然题目不全,但能感知出题方向和难度。Kaggle和天池的比赛不适合在考前突击,但如果时间充裕,做一次完整的数据分析项目对业务题帮助特别大。

3.3 业务Sense积累:从“会做题”到“会分析”

业务分析题最大的难点是“没话说”,看到一道开放的商业问题,脑子空白。要解决这个问题,最好的方法是建立“分析框架库”。比如流量下降分析框架、转化率提升框架、用户分层运营框架、商品推荐效果评估框架。每看到一道业务题,就往框架里填内容,不会没话说。

积累框架的渠道有很多:人人都是产品经理、知乎上的数据分析话题、各大厂的公开技术博客。但最有效的是你在实习或项目里真正碰过的业务问题。我在准备时把之前实习里做过的活动复盘、异动归因分析、用户增长实验报告翻出来重新梳理了一遍,把里面的思路提炼成模板。后来考试时遇到类似场景题,基本就是套自己的模板。

还有一个技巧,是平时多浏览电商平台,思考它的各种功能背后的数据指标。比如上线一个新功能“价保”,你会怎么评估它的价值;首页推荐流改版了,你想看哪些指标来判断是否回滚。这种日常训练很轻量,但积累多了业务题就不再是玄学。

3.4 模拟笔试与设备自查

考前我强烈建议至少做一次完整模拟笔试,用和真实考试相同的时长和题量。网上有一些模拟题平台提供限时测试,或者你也可以自己组一套题,设定90分钟倒计时,手机放在旁边录屏,模拟真实的紧张感。这一步能帮你提前暴露时间分配、手速、审题这些问题。

考试前一天还要检查:网络是否稳定,最好用有线网或5G热点;摄像头是否正常;电脑是否充满电;浏览器是不是官方要求的Chrome版本。我那次考试前一个同学就是因为摄像头驱动有问题,临时折腾了半天才进场,心态直接被搞崩了。注意,笔试平台一般会有防作弊提示,最小化窗口或者切屏次数过多会被记录,严重时直接判定作弊。所以考试期间不要切出去查找任何资料,哪怕是误操作也要尽量避免。

4. 常见问题与考场意外应对实录

4.1 题做不完怎么办

这是数据岗笔试最常遇到的问题,几乎每个考完的人都会懊恼“业务题没写完”。要解决它,考场上的策略很简单:保持每题有产出,比追求完美重要。SQL如果写不全,把with子句、核心join逻辑和最终select字段写出来,能得多少得多少;业务题时间不够就写一级标题和核心论点,别在某个小问上死磕。

再强调一遍:模块计时模式下,提前完成当前模块不能把时间留给下个模块,所以每个模块都要当独场考试对待。做题顺序上,建议先做会做的、题面短的、单位时间内得分率高的;逻辑题那种要读大段材料的,放最后。

4.2 平台卡顿或代码环境异常

在线笔试平台偶尔会有卡顿或者提交失败的情况,尤其高峰时段。遇到这种情况,先别慌,截图保存证据,然后尝试刷新页面重新进入(答题过程一般有自动保存)。如果问题持续,第一时间联系平台客服或公司HR,说明情况并附上截图。不要自己在那边鼓捣十分钟,每一分钟都是宝贵的答题时间。

编码题还可能出现“本地能跑,平台报错”的情况,常见原因包括:环境中没有某个函数(比如某些版本不支持regexp_replace)、字段名大小写问题、分号缺失。所以写代码时尽量用标准SQL,避免平台差异带来的问题。

4.3 遇到没见过的题型怎么办

2024年春招有一个新趋势:题目开始加入更多的开放性和情境性。比如“你是一个电商平台的数据分析师,C端用户反馈商品页加载变慢,请设计一个数据诊断方案”。这类题看起来像case interview,其实核心还是基础知识+分析框架。遇到陌生题型时,关键是把问题拆到你能处理的最小单元:用户反馈加载慢→前端性能监控指标(页面加载时长、白屏时间、接口响应时间)→受影响范围(版本、机型、地区)→对核心指标的影响(转化率、跳出率)→优化建议。哪怕你完全没做过性能分析,这个拆解思路也能支撑你写出一版有逻辑的答案。

4.4 最容易丢分的细节汇总

我把考后复盘和周围同学交流到的丢分点整理成一个表格,如果你能避开这些,基本就能超过大多数竞争者:

丢分点原因解决办法
SQL字段名/别名不一致没仔细核对题目要求提交前逐项检查select列名
统计检验条件不清楚用了z检验但样本量小记清z/t检验适用条件(n>30大样本用z,小样本用t)
业务题只有结论没有论证只写了“可能是新用户下降”学会用“指标下钻+数据佐证”的方式答题
答题时间前松后紧在难题上耗太久每题设2分钟上限,超时跳过
逻辑题被资料分析拖垮计算量大的题放在前面做先做图形推理和文字题,再回头做计算类
忘记看模块说明题量和分值不明开考后第一分钟先扫全卷,确认模块结构

还有一个细节:答题时可以适当用“序号+结论+理由”的结构,尤其在业务题里。阅卷人大概率是业务面试官或者刚入职不久的数据分析师,他们看卷子很快,你写得有条理,他们容易给高分。切忌一大段文字没有分层,就算逻辑是对的,人工阅卷也很难抓到要点。

写在最后:一次笔试教会我的事

从投简历到做笔试,整个流程看似只是招聘的一环,但它其实是一次很真实的自我诊断。我考完淘天这场最大的感受不是“题好难”,而是“有些知识我以为自己会了,但真到限时场景下才发现掌握得不够”。这种暴露问题的方式虽然让人难受,但比刷一百篇面经更有效。

考完笔试之后,我花了一整晚把每道题对应到知识点,重新过了一遍自己的知识体系,把薄弱项标记出来,在这个基础上准备后续的面试。笔试只是起点,但它决定了你能不能拿到面试的入场券,所以以终为始地去准备,效果会好很多。

最后给一个很个人的建议:无论你准备得多么充分,考场上一定会遇到不会的题,这是正常的。数据岗考察的不是“全知全能”,而是你在资源有限的情况下如何分配注意力和表达思路。哪怕某道题完全不会,只要你没让它在心理上击穿你,后面的题你就还有翻盘的机会。希望这篇复盘能对你有所帮助,祝看到这里的你笔试顺利。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询