跳到主要内容

科学方法

TL;DR

科学方法:(1) 观察现象;(2) 形成解释它的假设;(3) 设计旨在证伪假设的实验;(4) 运行实验;(5) 基于结果更新信念。关键纪律:设计旨在反驳而非确认假设的实验。科学方法的力量来自于系统性地容易被证明为错误——这就是为什么由它产生的信念是可靠的。


什么是科学方法?​

科学方法是将科学与意见区分开来的认识论程序。其核心创新是实验测试:与其争论哪种解释更合理,不如设计一个能明确反驳其中一种的测试。经受住反复严格证伪尝试的假设获得可信度;未能通过任何精心设计测试的假设被拒绝或修正。

现代形式化主要归功于卡尔·波普尔的20世纪科学哲学,他将可证伪性确定为区分科学与非科学主张的标准。一个主张如果是科学的,就必须在原则上可以被证明为假。"所有天鹅都是白的"是科学主张——一只黑天鹅就能证伪它。"一切皆有原因"不是科学主张——没有任何观察能证伪它。

应用于纯科学之外,科学方法为任何想要可靠区分真实信念与错误信念的情况提供模板:产品开发(A/B测试、可用性测试)、商业战略(市场实验、试点项目)、医学(临床试验)、个人决策(大型承诺前的小实验)。

科学方法不需要实验室。它需要:具体的、可证伪的预测;测试该预测的、能最小化混杂变量的方法;诚实报告包括反驳你假设的结果在内的所有结果;以及基于证据更新信念的意愿。


工作原理​

步骤1:观察并定义现象
——你在研究什么具体模式或问题?
——精确:"移动用户的转化率为2.3%",而非"移动端转化差"

步骤2:研究现有知识
——已知什么?存在什么解释?
——避免重新发明轮子或与既定发现矛盾

步骤3:形成具体的、可证伪的假设
——"如果X为真,那么在Z条件下应该观察到Y"
——必须足够具体以被推翻

步骤4:设计实验
——什么证据会证伪假设?
——控制混杂变量
——预先注册成功标准(在看到结果之前)

步骤5:收集数据
——严格运行实验
——测量你所说的要测量的内容

步骤6:分析结果
——结果支持还是反驳假设?
——应用适当的统计分析

步骤7:更新信念并报告
——如果结果反驳了假设,则修正假设
——诚实报告方法和结果,包括负面结果

三个现实案例​

产品开发中的A/B测试:多邻国假设连续学习天数(streaks)会增加留存率。应用科学方法:假设——看到第7天维护连续提示的用户将比未看到的用户30天留存率高15%;实验——随机分配50,000用户到提示组vs.无提示组;预先注册的成功标准——在95%统计置信度下提升≥15%;结果——18%留存提升;假设确认;更新——对所有用户部署连续提示并探索进一步的连续相关机制。没有科学方法(仅凭直觉"连续似乎好"),多邻国将无法可靠区分真正有效的东西与直觉上感觉好的东西。A/B测试允许多邻国每年运行数千个实验,每个结果都建立可靠、基于证据的产品策略。

医学临床试验:COVID-19疫苗:辉瑞-BioNTech的mRNA疫苗开发大规模使用科学方法。假设——两剂BNT162b2将在成人中将有症状COVID-19减少≥50%;实验——43,661名参与者随机分配到疫苗或安慰剂组;双盲(参与者和研究人员都不知道分配);主要终点——PCR确认的有症状COVID-19,第二剂后7天以上;结果——95%效力(170例确诊:安慰剂组162例,疫苗组8例);更新——监管紧急授权,数十亿人部署。双盲随机对照试验是金标准,正是因为它最大程度地控制了混杂变量(安慰剂效应、选择偏差、测量偏差)。

商业假设检验:创业公司假设添加免费试用将提高落地页付费转化率。假设——"开始免费试用"CTA将产生比"立即购买"更高的90天付费转化率;实验——50/50分流测试新访客,跟踪90天;控制混杂——相同广告支出、相同落地页内容,仅CTA不同;结果——免费试用CTA注册量高40%但付费转化率低25%——净效果负面;更新——免费试用吸引"试试看的人";在重新测试前完善资格认定机制。结果反驳了假设。没有受控实验,团队可能将更高注册量归因于免费试用并宣布成功,错过货币化降级。


何时使用​

✅ 科学方法为以下情况规范思维​

  • 检验因果主张的任何实验
  • 基于A/B测试的产品决策
  • 通过试点项目验证商业战略
  • 应基于证据而非不顾证据捍卫更新的个人信念

❌ 不太直接适用的情况​

  • 无法重复实验的一次性决策
  • 伦理问题(科学提供信息但不解决规范性问题)
  • 实验周期太慢的时间紧迫决策
配合使用效果
可证伪性可证伪性是科学方法的哲学核心
贝叶斯思维贝叶斯更新形式化了如何从实验证据修正信念
最小可行测试MVT在资源受限的环境中高效应用科学方法
5个为什么5个为什么生成科学方法随后检验的假设

常见误用和局限​

**HARKing——知道结果后假设。**看到数据后形成假设,然后像预先指定一样呈现。这会产生看似显著但实际是噪音模式匹配的结果。预先注册(在看到结果之前发布假设和方法)可防止此问题。

**效力不足的研究。**运行太小而无法检测真实效应的实验。200用户的A/B测试无法可靠检测5%的提升;需要数千用户。效力不足的研究频繁产生假阴性(未能检测真实效应),矛盾地产生膨胀的假阳性。

**混淆相关性与因果性。**科学实验旨在隔离因果关系。没有随机分配的观察性研究可以显示相关性但不能显示因果性。这种混淆产生大量糟糕的健康建议、商业神话和政策错误。

**忽视负面结果。**出版偏差(优先发表正面结果)腐蚀科学记录。在商业环境中,等效的是"挑选"确认先前信念的实验。诚实报告负面结果对学习至关重要。


相关模型​

模型关系
可证伪性使假设检验有意义的哲学标准
贝叶斯思维从实验证据更新信念的正式框架
最小可行测试在资源受限的环境中高效应用科学方法
黑匣子思维创造科学实验意愿的文化心态

常见问题​

什么使假设"科学"vs"非科学"? 遵循卡尔·波普尔:假设在原则上可证伪——如果存在某种可能的观察能证明它错误——则是科学的。"锻炼改善心血管健康"是科学的(我们可以设计可能反驳它的研究)。"一切皆有原因"是不可证伪的——没有任何观察能反驳它,因为任何反证都可以被重新解释为"原因"的一部分。不可证伪的主张不一定错误;它们只是在科学上不可检验。

没有正式实验室或统计团队如何应用科学方法? 关键纪律可在没有正式基础设施的情况下实现:(1)在收集数据前陈述假设;(2)设计真正能证明假设错误的测试;(3)诚实收集和报告结果,包括失败;(4)基于发现更新信念。在商业环境中,即使是简单的前后对比、市场子集的受控试点、或足够样本量的基本A/B测试,也无需统计学博士即可提供科学纪律。

为什么复制很重要,"复制危机"是什么? 科学通过独立复制进步——其他研究人员运行相同实验并检查是否得到相同结果。无法复制的发现可能是侥幸或偏差的结果。"复制危机"(2011年至今)指发现心理学、医学和社会科学中发表的发现出人意料地大比例无法复制。促成因素包括小样本量、HARKing、出版偏差和p-hacking。危机促使改革包括预先注册、开放数据和更大规模的复制研究。


延伸阅读​

  • Popper, K. (1959). The Logic of Scientific Discovery — 可证伪性的哲学基础
  • Kuhn, T. (1962). The Structure of Scientific Revolutions — 科学范式如何转变
  • Kohavi, R. et al. (2020). Trustworthy Online Controlled Experiments — 大规模A/B测试

用AI应用​

🚀 用MindMax为你的假设设计实验 →


本页面是MindMax思维模型知识库的一部分。