“P < 0.05” 是怎么批量制造学术垃圾的
Description
在统计学里,你可能见到过P<0.05,代表结论显著,但P=0.051就不具有统计学的显著性了。这么规定有啥科学依据吗?不好意思,100年前咱们统计学祖师爷Fisher随手划的... Fisher本人也没想道,这图省事的一划竟然支配了学术圈上百年,催生了大量无法复现或撤稿的垃圾论文。 今天,就跟大家聊聊P值的真相。
在统计学里,你可能见到过P<0.05,代表结论显著,但P=0.051就不具有统计学的显著性了。这么规定有啥科学依据吗?不好意思,100年前咱们统计学祖师爷Fisher随手划的... Fisher本人也没想道,这图省事的一划竟然支配了学术圈上百年,催生了大量无法复现或撤稿的垃圾论文。 今天,就跟大家聊聊P值的真相。
Comments
万物皆可拟合[doge]
♥ 946 ↩ 16
贝叶斯只活了一年,6
♥ 766 ↩ 16
他就只活了一年吗?
♥ 450 ↩ 10
R²不在高,能圆就行;P不在精,会扯就灵。
♥ 449 ↩ 4
[doge]
♥ 160 ↩ 12
这下知道数学一为什么要考概率论与数理统计了吧
♥ 171 ↩ 13
统计本来就是描述不是解释,再进一步好多统计指标描述是相关性而非因果性。那么是哪些学科最喜欢用统计指标发论文呢[doge]
♥ 134 ↩ 23
看到有个神评论:学术造真[星星眼]
♥ 111 ↩ 1
评论区真是暴露教育水平,统计学在研究什么都没搞懂,营销号稍微带带节奏就开始攻击统计学。 统计学回答的问题是“如果理论预测正确/错误,那么观察到这个现象的机会是多少”,从而证明/证伪一个理论;而不是在回答“这个理论成立/不成立的机会是多少”。所谓的科学是可证伪的,证伪过程就是统计方法。可以说统计学是现代科学的基石之一,是理论科学和实验科学的粘合剂。 理解了统计学的定位,就应该知道统计学是验证工具。你提出一个命题,它只负责告诉你命题是否为真。垃圾论文本质上是因为主题本身垃圾。如果你的问题是某种糖和糖尿病是否相关,那统计学就帮你证明相关。但是反过来,你提出胰岛素与糖尿病的相关性,甚至提出作用机理,然后通过实验证实的过程,不是一样在重复“如果我的理论是错的,那么观测到这样的实验现象的机会是多少”这样的问题吗?
♥ 160 ↩ 12
哎 去年刚从中科院心理所毕业 我的所长导师就是这么操作的 13点生物运动刺激没显著 就让我换41点再收集一批被试 [笑哭] 关键是这样的人还是院士在申 我感觉属实德不配位了
♥ 95 ↩ 10
硬币投了9次都是正面,下次是正面的概率是多少 频率派: 50%,但是由于p<0.05倾向于认为硬币不公平 贝叶斯派:91%,因为我认为你的硬币83%概率是两面为正 缝合派:我有超过85%的把握认为你的硬币两面为正的概率>95%,但我给不出结论因为这缝得一坨
♥ 82 ↩ 2
假从来不用造,造的是“真”[doge]
♥ 69
建议都按高能物理的标准,5倍sigma才算发现,看你们怎么水论文[阴险]
♥ 84 ↩ 11
有一篇论文的标题很有意思:“显著”与“不显著”之间的差异并没有统计显著性(The Difference Between “Significant” and “Not Significant” is not Itself Statistically Significant)。 正因为显著和不显著之间用一个0.05一刀切的原因,因此微小的数据波动就有可能导致显著变为不显著或者由不显著变为显著,从而导致结论发生两极反转。 你不能对显著和不显著之间的差异应用显著性检验,因为高一阶的显著性检验本身又需要再应用一层更高一阶的显著性检验来检验其显著和不显著之间的差异,导致显著性检验的无限套娃。
♥ 61 ↩ 2
这就想起来我本科论文模型导入后P算出来0.6,当时给我和我哥们一起气笑了,两人也不做实验了去食堂吃了一顿[笑哭]
♥ 55 ↩ 4
统计学显著性有其局限性,但目前也是最科学的学术通用语言。你说他不对,不好,那你拿出一套更加公认的系统出来。达到一定水准的SCI论文,会要求多模型交叉验证,而且科研的逻辑是环环相扣的,自己做的东西自己复现不出来,后面就做不下去。你举这个例子,什么绿色软糖引起痤疮,那有什么用呢,做一个没有用的表型,挖掘不出任何机制和治疗潜力,哪个正常期刊会要?一般正常的生物实验室都会对自己的东西负责。学术不端案例也有存在,但不能把极端案例当成普遍现象,这何尝不是另一种P<0.05。天天口中学术造假的那群人,你问他有什么成果,脚踏实地做出了些什么东西,往往一点也答不上来。
♥ 83 ↩ 20
虽然up拿法律举例子主要是为了引入概率论的概念,但也需要注意在缺乏扎实的理论基础直接利用概率论工具处理法律问题是存在着事实上的风险的,有兴趣的可以看一看《证据法学:原则、规则、案例》里第七章第五节的人民诉科林斯案例
♥ 53
P值的精确解释是: 在零假设成立的前提下,获得至少与实际观测结果一样极端的检验结果的概率 (也就是视频里画条线右边那部分). 这其实非常符合直觉, 一点也不反直觉: 如果我的假设是真的, 我发现一个数据出现的概率低到一个程度, 我就可以说我原来的假设不成立了(直觉上是更宽松的反证法). 你可以说p=0.05是个随手一画的数值, 不应该以此就把0.051扔掉, 但这与后面提到的问题无关, 把α设置成0.01, 0.0001, 0.000000000000001都不影响你后续提到的问题, 而且5%和1%实际上也挺符合本能的, 让我随机选α估计也是整数百分比, 毕竟是个挺无关的数值, 但防止实验操纵总需要事前设定个标准. 更常见的误解其实是: 1. 错误理解零假设, 一个具体检验的H₀除了那个显式写出的xxx=0, 还隐含了这个检验本身的假设, 一个低的p值不一定是把你xxx=0的假设推翻, 可能是推翻整个检验; 2. 误将p值理解为效应强度, 两者相关但不一定; 3. 误将p值理解为因果联系, p值因果一点关系没有, 和实验设计有关。 视频最后的问题Bayes学派也解决不了, 因为其同样可以做假设检验, 也可以由相同的定义得到p值, p值的问题与你选择哪个学派没有关系, 你不能说频率学派引入了p值就只能频率学派用吧? 还有CI的引入和提到的问题几乎无关, CI和p-value就完全是一回事, 这俩完全互推, 怎么能解决p值的问题? 对于多重检测和假设敏感做的补丁分别是 Multiple testing correction/FDR-adjustion/q-value/p mixture 和 各种非参检验(不基于数值或分布而基于排序)以及采样或校准方法(Empirical p-value, p-value calibration相关的一套方法)。 不是,也算是大自媒体了, 能不能发之前找个学统计的看一下[笑哭]
♥ 44 ↩ 7
你说P小于等于0.05,我都怀疑你到底查没查过资料。评论区还有人想单挑经济学的研究方法,那我简单说一下。我们一般是先做描述性统计,对数据有个大致判断,再结合现实生活的直观理解和经济学的直觉提出假设,最后用P值或t统计量来验证。我们根本不会用P小于等于0.5这种数值,通常取的是P小于等于0.01。为什么选0.01而不是0.1,背后涉及第一类错误和第二类错误的权衡,是有严格理论依据的,不是随口乱猜。 另外我们会加入各种控制变量,排除其他因素的干扰,还会做多种稳健性检验,比如换变量定义、换样本区间、用不同的计量方法重新跑一遍,看看结论是不是还站得住脚。这些在现实的经济学论文里都是基本操作,不是随便跑个回归就完事。 如果你真想批评灌水研究,不如直接去炮轰那些做案例研究或者机器学习的。你想想那些把不同模块缝合一下,AUC、MSE、MAE、RMSE这类指标只提升了一两个百分点就发文章的做法,是不是更水。相比之下,经济学的研究好歹还有点现实意义。 此外同时出现了多个不想干账号进行p-hacking的批判,我觉得肯定是有问题的。
♥ 55 ↩ 6