数据科学这几年确实火,但大部分人把它当成一门“工具学”,学一堆模型、跑一堆代码、画一堆图表,最后发现做的报告没人看、预测的模型上线就崩。问题出在哪?我做了这么多年数据相关的工作,越来越觉得:数据科学真正难的部分不是技术,而是怎么理解数据本身。这恰恰是哲学能帮上忙的地方。哲学与数据科学,听起来一个在云端一个在泥土里,但它们交汇的那个点,才是深入思考数据、真正让数据产生价值的地方。
这篇文章我会把两者怎么结合讲透,也会聊聊数据科学与大数据技术这个专业的就业方向和职业核心能力,以及一个很实际的例子:从点击归因到预算优化的闭环实践。想入行的、已经在坑里的、或者单纯对数据感兴趣的,都能从里面找到点能直接用的东西。
1. 数据科学不是单纯的技术活——先想清楚“数据是什么”
1.1 数据是世界的投影,不是世界本身
很多人对数据有个误解,觉得数据就是事实。报表上显示“用户停留时长下降了20%”,大家就开始慌,觉得产品出问题了。但数据不是事实本身,它只是世界某个侧面的投影。就像你拿手电筒照一个球,影子是个圆,但球本身是三维的。你看到的数据,取决于你的手电筒照在哪里、用什么角度照、光照强度多大。
这个“手电筒”就是你的数据采集方式。举一个最常见的例子:两家电商平台都在统计“用户购买转化率”,一家用“点击购买按钮且支付成功”作为口径,另一家用“加入购物车且停留超过10秒”作为口径。结果A平台转化率5%,B平台转化率15%,B平台的高管兴高采烈,但真实情况可能完全相反——B平台的统计口径更宽,混入了大量无效行为。
我以前带团队时,每个季度都要做数据复盘,第一件事不是看数字涨跌,而是先问:这个数字是怎么来的?采集链路有没有变更?口径是否一致?如果不做这个哲学层面的追问,你只是在数字的迷宫里打转,用错误的数据推导出看似正确的结论。
1.2 数据科学的核心问题:测量、表征与简化
深入思考数据,绕不开三个哲学问题,这三个问题贯穿数据科学的所有环节。
第一个:测量问题。你测的真的是你想测的吗?我想衡量“用户体验”,但我没法直接测“体验”,只能测“页面加载时长”“点击热力分布”“客服投诉率”。这些指标是体验的代理变量,但代理不等于本体。页面快了用户就一定满意吗?也许内容本身很烂,只是加载快所以骂的人少。
第二个:表征问题。数据用什么形式表达?同一份数据,用平均数还是中位数?用柱状图还是散点图?表征方式会直接影响你的判断。我见过一个案例:某个功能上线后“人均使用时长”大幅提升,团队觉得大获成功,但把数据按用户分层后才发现,提升全部来自头部5%的重度用户,普通用户根本不碰这个功能。平均数掩盖了分布的真相,这就是表征带来的误导。
第三个:简化问题。任何模型都是对现实的简化,你不可能把所有变量都放进来。但简化到什么程度合适?这本身就是一个价值判断。做点击率预测模型,你用10个特征还是50个特征?特征少了模型太粗糙,特征多了过拟合,而且很多特征本身就有相关性,放进模型里可能放大噪声。
这三个问题没有标准答案,但一个有数据哲学思维的从业者,会时刻带着这些问题审视自己的工作。这也是为什么我认为,数据科学的上限,取决于你对数据的理解深度,而不是你调参的手速。
2. 用哲学思维搭建数据科学工作流:从点击归因到预算优化
2.1 归因的本质:一个哲学上的因果问题
所有做广告投放、做增长的人,都绕不开点击归因。用户看了你的广告、点了、三天后买了东西,这个订单算谁的?算最后一次点击的渠道?还是第一次曝光的渠道?这就是归因。
归因问题本质上是一个因果关系问题,而因果是哲学里最古老的难题之一。休谟早就说过:我们看到的只是先后相继,而不是因果本身。用户先点了A渠道的广告,然后购买了,A渠道就“导致”了购买吗?也许用户早就决定要买,只是通过A渠道点进来而已。
所以归因模型本质上是你对用户决策过程的一种假设,而不是客观事实。你会遇到这么几种常见模型:
- 首次归因:功劳全给用户第一次接触的渠道
- 末次归因:功劳全给最后一次点击的渠道
- 线性归因:每个触点平分功劳
- 时间衰减归因:越接近转化的事件权重越高
- 数据驱动归因:用算法基于历史数据计算每个触点的边际贡献
我在实际项目中通常建议:前期用末次或线性归因快速跑通,数据积累足够后切换成数据驱动归因。为什么?因为数据驱动归因需要足够的转化量才能算得稳,小预算账户强行上数据驱动,结果就是模型方差极大,今天权重全给A渠道,明天全给B渠道,完全没法作为决策依据。
但比选哪个模型更重要的,是理解归因模型永远只是对真实因果链的近似。一个用户可能在看到你的品牌广告两周后,通过搜索品牌词进来了,归因系统只能看到“搜索品牌词”这个末次触点,而看不到两周前品牌广告种下的“心锚”。这不代表品牌广告没用,只能说明归因模型的视野边界有限。
2.2 从归因到预算优化的闭环实践
理解了归因不等于真相之后,就可以开始搭建一个从归因到预算优化的闭环。我来拆解一个我实际跑过的流程,这个流程也被很多团队验证过,整体分成四个环节。
环节一:数据采集与清洗
这个环节的关键是打通各渠道的数据。广告平台(巨量引擎、腾讯广告、Google Ads)、自有站点统计(GA、神策)、内部订单系统,三端数据要做用户级别的ID映射。常见做法是用设备ID或用户登录ID作为统一主键,再用时间戳和归因窗口做触碰匹配。
这个环节最常踩的坑是数据口径冲突:广告平台的“转化数”用的是平台自己定义的归因逻辑,内部系统的“订单数”是真实的成交记录,两边数据对不上很正常。成熟的团队会以内部订单系统为准,把广告平台的转化数据只作为参考维度,而不是直接拿来算ROI。
环节二:搭建归因模型
根据业务特点选归因模型,这里给一个实用的参数配置参考:
- 归因窗口:电商默认7天点击+1天曝光,高客单价商品(比如装修、教育课程)建议30天点击窗口
- 触点上限:单用户最多记录10个触点,超出部分按时间倒序保留最近10个
- 去重点击:同一个用户1小时内对同一条广告的多次点击,合并为1次
我见过新手直接把所有点击都算上,结果一个用户一天点了8次广告,8个触点全记上,归因结果被严重稀释。去重不是可选项,是必选项。
环节三:预算分配决策
有了归因结果,你可以输出每个渠道的ROI。假设现在有三个渠道,A渠道ROI是3.5,B渠道ROI是1.2,C渠道ROI是0.6。直觉是把预算全部砍给A,但这样做很危险。
为什么?因为ROI是一个边际递减的指标。A渠道你投5000块的时候ROI是3.5,投5万的时候流量翻倍但人群被洗过好几轮了,ROI可能跌到1.8。所以正确的做法是看各渠道在不同预算档位下的边际ROI,而不是当前ROI。
实操中我一般这么做:
- 保持A渠道预算不变,观测自然波动
- 把B渠道预算增加20%,观察ROI变化
- 把C渠道预算砍掉50%,观察对整体转化量的影响
- 两周后汇总数据,计算边际ROI,再决定下一轮调整
这就是一个小步快跑、数据反馈、再调整的闭环。这里面的哲学思想是波普尔的“试错法”:提出假设、检验、推翻或修正假设,而不是拍一次脑袋定全年计划。
环节四:反馈迭代
预算调整不是一劳永逸的。市场在变、竞品在变、用户偏好也在变。我建议至少每周看一次数据看板,每月做一次归因模型复盘,每季度做一次整体预算规划。闭环的价值在于它让每一次投放都成为一次可学习的实验,而不是一次性的赌博。
2.3 实验思维:数据科学工作流的底层保障
归因模型再准,也只是观测数据,观测数据最大的问题是混杂变量。你发现A渠道ROI高,可能是因为A渠道的流量质量本来就高,但A渠道也在节假日集中投放过大促广告,这个“大促”就是混杂变量。
要真正搞清楚因果,AB实验是不可替代的手段。数据科学工作流里,实验能力应该像呼吸一样自然。具体设计实验的时候,这几个参数要关注:
- 最小可检测效应(MDE):你想检测出5%的转化率提升,还是10%?MDE越小,需要的样本量越大
- 显著性水平:一般取0.05,但要考虑多重比较问题,跑10个实验就得校正
- 检验功效:一般取0.8,功效太低实验容易得出假阴性结论
- 实验时长:至少要覆盖一个完整的业务周期。电商至少要包含一个周末,B2B业务至少要覆盖一个采购周期
样本量估算可以使用一个近似公式:每组样本量 ≈ 16 × σ² / δ²(σ是标准差,δ是你要检测的最小差异)。假设你的转化率是5%,标准差约为0.217,想检测出0.5个百分点的提升(也就是从5%到5.5%),δ=0.005,那么每组需要约 16 × 0.217² / 0.005² ≈ 30110 个用户。跑实验前先算清楚,不然跑了三周数据不显著,纯粹浪费时间。
3. 数据科学与大数据技术:专业与职业全景拆解
3.1 这个专业到底学什么、出来能做什么
“数据科学与大数据技术”是近几年高校开设非常多的本科专业,很多学生和家长对这个专业一头雾水,觉得是不是就是“学数据库的”或者“搞编程的”。其实这个专业的定位很清晰:用数据解决实际问题的复合型人才。
课程体系一般覆盖三大块:
数学与统计基础:高等数学、线性代数、概率论与数理统计、统计学、随机过程。这一块是数据科学的“内功”,决定你能不能在算法上走远。我面试过很多候选人,Python写得很溜,但问他“什么是P值”“什么是置信区间”,支支吾吾说不清楚,这种候选人在处理复杂业务问题时往往很吃亏。
计算机与工程能力:数据结构、数据库原理、操作系统、机器学习、数据挖掘、大数据平台(Hadoop、Spark)。这一块是“招式”,但请注意:工具会过时,十年前流行的Hadoop MapReduce现在已经被Spark、Flink这些替代了一大半。所以学的时候要重点关注底层原理,而不是只记命令。
业务与领域知识:数据可视化、数据产品设计、数据分析方法、行业应用实践。这一块很多学校教得比较弱,但工作后恰恰最重要。同样是数据分析师,在电商行业和医疗行业,面临的数据形态、分析思路、业务约束完全不同。
就业方向综合来看有这么几大类:
- 数据分析师:偏向业务侧,负责出报表、做专题分析、支持业务决策。入门门槛相对低,但天花板取决于业务理解深度
- 算法工程师:偏向技术侧,负责模型训练、调优、上线。薪资高,竞争也激烈,需要扎实的数学和编程功底
- 数据产品经理:偏向产品侧,负责数据平台、数据工具、指标体系的产品设计。这个岗位既要求懂技术,又要求懂用户和业务,稀缺度较高
- 数据工程师:偏向底层,负责数据采集、清洗、仓库搭建、管道运维。很多学校专业不直接培养这个方向,都是干中学
- 商业分析师/经营分析师:偏向管理侧,服务于CEO/高管,把数据转化为经营洞察和战略建议
3.2 数据科学职业核心能力拆解:除了技术还有什么
现在大家都在聊数据科学的职业核心能力,我基于自己的面试和管理经验,把它拆成五个维度,按重要性排序(对,技术不是第一位的):
第一:定义问题的能力。业务方说“帮我看看用户为什么流失”,如果你直接开始取数、做分析,大概率做出来一堆没人看的东西。真正厉害的数据人会先反问:什么是流失?沉默多久算流失?流失对营收的影响有多大?你说的是一个现象还是一个需要决策的问题?能把模糊的业务诉求转化成清晰的数据问题,这是数据科学家和取数工具的本质区别。
第二:数据敏感度。看到一个数字异常,能不能快速判断是采集问题、口径变化、还是真实的业务波动?这种敏感度来自大量实战积累,但也有一套方法论:先看数据链路(数据从哪来,经过了哪些处理),再看同环比(周期性波动的规律),最后看分层拆解(是整体波动还是局部波动)。
第三:量化思维能力。说白了就是“一切皆可量化”的思维。用户体验能不能量化?可以,用净推荐值、任务完成率、使用频次。品牌影响力能不能量化?可以,用搜索指数、舆情情感分数、品牌词自然搜索量。“感性”的业务概念一旦转化为“可测”的指标,数据工作才有抓手。
第四:技术实现能力。SQL是基本功,Python/R至少会一个,机器学习的常用算法要能说清楚适用场景和优缺点。技术不是万能的,但连技术都没有,你想验证的很多想法根本落不了地。
第五:沟通与讲故事能力。数据不会自己说话,是你替它说话。同样一份分析报告,有人讲完业务方频频点头,有人讲完大家一脸迷茫。差别在于后者沉浸在技术细节里,前者把结论翻译成了业务语言。
3.3 数据科学与大数据技术就业方向的真实生态
给大家一个真实的就业市场感知,而不是招聘网站上的岗位描述。
互联网大厂:岗位分工细,数据平台成熟,你进去之后可能只负责某一条业务线的某一个指标。优点是平台视野好、有成熟的导师体系;缺点是一不小心就变成“高级取数机”,每天忙于接需求,没有时间深入思考。
中型互联网公司:岗位边界模糊,数据科学、数据分析、数据工程经常一个人全包。你能接触完整的链路,成长快,但需要很强的自驱力,不然会被业务方的临时需求淹没。
传统行业数字化转型:银行、零售、制造、医疗,这些行业正在大量招聘数据人才。薪资可能不如互联网,但胜在稳定、竞争压力相对小,而且数据工作更能落在实体业务上,成就感比较实在。比如制造业里的质检数据、供应链需求预测,做好了那种实际效益非常直接。
外企与咨询公司:更看重结构化表达和商业分析能力,通常服务企业内部决策或外部客户项目。这类岗位英文要求较高,但工作节奏和成长路径也比较清晰。
我的建议是:第一份工作尽量去一个能让你完整做完至少一个数据项目的地方,不管是公司规模大还是小。完整做完一个项目的意思是:你经历了从模糊的业务问题到清晰的数据定义、从数据采集到清洗、从分析建模到输出报告、再到业务方采纳你的建议并落地。这样的闭环经验,比在PPT上列十个“精通XXX”都有说服力。
4. 深入思考数据的实操方法论:从入门到进阶的思维方式
4.1 一个具体案例:一次用户留存分析是怎么做的
拿一个我印象很深的项目举例。一款内容类App,次月留存率连续三个月下滑,业务方很着急,让我分析原因并给出建议。
我接这个需求后,没有直接取数,而是先花了两天和产品、运营分别聊了一轮。从中了解到几个关键背景:上季度上线了一个新的个性化推荐算法,运营策略从“人工编辑推荐”转向“算法推荐”,同时做了一个改版把社区入口从二级页面提到了首页。
这些背景信息给了我分析的两个重要切入点:算法变化和入口变化。然后我才开始真正动手,整个分析流程可以参照下面的思路来做:
- 第一步:定义留存。次月留存的用户定义是什么?是“当月至少登录一次”还是“当月至少使用核心功能一次”?口径不同结论完全不同
- 第二步:按用户分层拆解。分新老用户,分使用深度(低频/中频/高频),分内容偏好类型
- 第三步:寻找变化节点。用趋势图看留存曲线在哪一周开始明显下滑
- 第四步:对照业务事件。把版本上线时间、算法调整时间、运营活动时间标注在时间轴上,观察相关性
- 第五步:做分群对比。比如“用了新推荐算法的用户”和“仍使用旧逻辑的用户”(如果还能区分)留存差异如何
最后我的结论是:留存下滑主要集中在新用户群体,而新用户中有大量“泛娱乐用户”被算法推荐了过度垂直的内容,缺乏他们感兴趣的生活化内容;同时社区入口上提到首页后,新用户第一次进来就被社区内容分散了注意力,没能完成“首次核心行为”——完整观看一个中长视频。所以看似是留存问题,深层原因一是推荐策略和用户结构错配,二是新用户引导路径被改版干扰。
这个结论直接落地成了两个动作:推荐策略增加“新用户探索期”,以及改版后优化新用户前3分钟的引导。一个月后,新用户次日留存明显回升,虽然次月留存还没完全恢复,但趋势已经止住。
这个案例想说明的是:数据分析的核心不是图表多精美、模型多高级,而是你能不能识别出用户行为背后的“因果机制”。如果没有前期业务背景调研,我大概率会在数据里挖出几十个“相关因素”,最后给出一堆正确的废话。
4.2 数据科学常见的坑与排查技巧
做数据这行,踩坑是家常便饭,但很多坑是有规律可循的。我把这些年遇到的高频问题整理成一个速查表,方便你对号入座。
| 问题现象 | 可能原因 | 排查思路 |
|---|---|---|
| 两个报表数据对不上 | 统计口径不同、时区差异、去重逻辑不同 | 先对齐事件定义和SQL逻辑,再比对明细数据 |
| 转化率大幅波动 | 刷量攻击、采集代码异常、节假日效应 | 检查异常流量特征,看采集logs,找业务日历对照 |
| 模型上线效果远低于离线测试 | 训练集与线上数据分布不一致、特征穿越 | 做数据分布漂移检测,检查特征是否用了未来信息 |
| AB实验不显著 | 样本量不够、实验时长不足、指标波动太大 | 算最小样本量,拉长实验周期,换更敏感的指标 |
| 归因结果和直觉完全相反 | 归因模型选择错误、数据未打通 | 先跑多种归因模型对比,再检查ID映射是否完整 |
4.3 如何训练自己的“数据哲学思维”
最后这部分我想给一些训练方法,让你在日常工作中就能逐步建立深入思考数据的能力。
第一,每个数据结论前加一句“在XX条件下”。这不是学究气,而是数据人最基本的严谨。你说“用户更喜欢A页面”,要加定语:“在过去的30天内,访问官网且Cookie未清的用户中,A页面的停留时长显著高于B页面。”加了条件之后,你自己都会发现很多结论其实非常脆弱。
第二,主动找反例。做完一个分析,不要急着下结论,先想想:什么情况下这个结论不成立?有没有某个人群、某个时间段是反例?这种“证伪思维”能帮你避免很多认知偏见。我每次给管理层出报告前,都会强迫自己列出至少三个“反例场景”,如果找不出来,说明我可能没思考透彻。
第三,建立指标体系的“第一性原理”视角。每个指标往上追问一层:这个指标变化,最终影响公司的什么核心目标?如果一个指标和公司营收、成本、用户体验都挂不上钩,那很可能就是虚荣指标,看一眼就行,不值得作为决策依据。我在做数据中台时,曾经梳理过800多个指标,最后真正被业务方高频使用的也就三四十个。指标多不等于数据好,指标可解释、可行动、可闭环才重要。
第四,多问“用户为什么这样做”。数据只能告诉你发生了什么,不能告诉你为什么。看到用户流失曲线,不要急着建模预测谁会流失,先试着想一下:如果你的朋友使用这款产品,什么情况下他会离开?这看起来不像数据分析,但恰恰能帮你构建“体感”,再回到数据里去验证体感。很多合格的数据分析师不缺技术,缺的是对真实世界的感知。
数据科学这个行当,工具更迭快得吓人,今天学Spark,明天出了Flink;今天流行GBDT,明天Transformer。但本质的东西没变过:你如何看待数据,决定了你能从中挖掘出什么价值。哲学与数据科学的交汇处,不是高深的思辨游戏,而是每一个具体决策背后的判断力。这种判断力,才是数据从业者真正不可替代的护城河。
我个人这些年最深的一个体会是:数据工作做得越久,越觉得自己在跟一堆“概率和近似”打交道。没有绝对的真相,只有不断逼近真相的方法。所以每次拿到一个数据结论,我都会习惯性问一句:如果这个结论是错的,最可能是哪里出了问题?这个习惯让我少走了很多弯路,也推荐给所有在数据路上前行的朋友。