| 查看: 66 | 回复: 0 | |||
[交流]
论文里最常见的 8 个统计错误,审稿人一眼就能挑出来
|
|
论文里最常见的 8 个统计错误(审稿人一眼就能挑出来) 数据做完了、图也画了,但统计分析经不起推敲——这是"大修/拒稿"里非常高频的一类意见。 下面 8 个是最常见的,「自查一遍能挡掉大半」。 1. 样本量不足就开始分析 最常见的硬伤:30 个样本做结构方程、20 个人的实验做方差分析。 经验底线: · 描述性研究:200–400 份 · 回归/结构方程:题目数 × 10~20 倍 · 「分组比较」:每组都要够,不能只看总数 ?? 样本量不够时,最稳的做法不是"硬跑",而是「用非参数方法 + 在局限性里说明」,比报出一堆不可靠的显著结果安全得多。 2. 把 p 值当成"结论强度" `p < 0.05` 只说明"这个差异不太可能是偶然造成的",「不代表差异有多大、更不代表重要」。 规范做法:「同时报效应量」(Cohen's d、η?、OR 值等)和置信区间。 只写"p<0.05,有显著差异"的分析,容易被要求补报。 3. p = 0.000 这种写法 统计软件输出的 `0.000` 不是"完全没有概率",是「小于 0.001 被四舍五入」了。 正确写法:`p < 0.001`。 4. 多重比较不做校正 做了 10 组两两比较,直接看哪些 p<0.05 就下结论——这叫"数据挖掘",假阳性率会大幅上升。 至少要说明用了什么校正(Bonferroni、FDR / Benjamini-Hochberg 等)。 5. 相关当成因果 "X 与 Y 显著相关" ≠ "X 导致 Y"。 除非你有实验设计、工具变量、DID 这类能支持因果推断的设计,否则措辞必须用"相关""关联",「不能写"影响""导致"」。审稿人对这个特别敏感。 6. 缺失值处理太随意 · 直接删掉缺失样本?→ 要说明删除比例,比例高会引入偏差 · 用均值填补?→ 会低估方差,一般不建议 · 推荐做法:说明缺失机制,用多重插补(MI)或最大似然,并做敏感性分析 「至少要在方法部分交代一句缺失值的处理方式」,完全不提是常见扣分点。 7. 检验方法选错 | 情形 | 常见错误 | 正确选择 | |---|---|---| | 小样本、非正态 | 用 t 检验 | Mann-Whitney U / Wilcoxon | | 三组以上比较 | 连做多次 t 检验 | ANOVA + 事后检验 | | 重复测量 | 用独立样本检验 | 重复测量 ANOVA / 混合模型 | | 分类变量关联 | 用相关分析 | 卡方检验 | 判断前提是「先做正态性和方差齐性检验」,并把这个过程写进方法里。 8. 图表和统计方法对不上 · 图里画的是均值±标准差,正文却报了中位数 · 标注的显著性符号(、「)没说明对应什么检验、什么水平 · 误差棒没说是 SD 还是 SEM(」这两个含义完全不同,必须标注「) 审稿人看图表的时间比看正文还多,这类不一致最容易被抓。 --- 一份自查清单(投稿前过一遍) · [ ] 样本量依据说清了吗?(有没有做功效分析) · [ ] 正态性、方差齐性检验做了吗?写进方法了吗? · [ ] 每个统计结论都报了效应量或置信区间吗? · [ ] 多重比较做了校正吗? · [ ] 有没有把"相关"写成"影响/导致"? · [ ] 缺失值怎么处理的?写了吗? · [ ] 图表的误差棒、显著性标注都说明了吗? · [ ] p 值有没有写成 0.000? --- 」如果审稿意见里有"统计方法不当"这类意见、或者你自己不确定该用哪个检验「,可以把你的研究设计和数据情况发我,我帮你判断该用什么方法、怎么补救——」统计部分返工成本很高,提前对一遍能省一轮大修。 |
» 猜你喜欢
我应该选哪条合成路线让实验成功率高一些?
已经有8人回复
烦躁
已经有8人回复
入职后第一次管课题组的专利缴费,对账才发现官费比别人多掏了一倍
已经有3人回复
各位大佬,路线设计求助
已经有7人回复











回复此楼