Gauquelin 的火星效应究竟说了什么?
1955 年,法国心理学家 Michel Gauquelin 公布了一个后来被称为火星效应的假说:体育冠军出生时,火星在天空中某些特定位置出现的频率高于普通人出生时。具体来说,火星从升起到落下的视运动轨迹被分成六个相等的部分,称为六分宫,其中第一宫从火星升起时开始,第四宫从火星经过南北子午线时开始。对体育冠军而言,两个关键宫是第一宫和第四宫。
据 Nienhuys 所述,Gauquelin 认为在优秀体育冠军群体中,出生时火星位于关键宫的比例并不在总人口约 17% 的基线附近,而是更高,约为 22%。这是一个统计学断言,不是象征性的解读,因此可以用独立数据来检验。正因如此,它成了持续数十年争论的焦点。
为什么两位严肃的心理学家曾认为 Gauquelin 式相关值得继续研究?
在 1982 年出版的《Astrology: Science or Superstition?》一书中,Hans J. Eysenck 和 David K. B. Nias 得出结论:传统占星术整体上未得到数据支持,但唯独 Gauquelin 式相关值得继续研究。这是一个有区分的结论,不是对占星术的全盘接受。需要说明,这是这两位心理学家的结论,不是研究界已经达成共识的结论。
Eysenck 是 20 世纪最有影响力的心理学家之一,以人格与智力研究闻名。他对被主流科学边缘化的议题也持有不同寻常的态度。在 1986 年的一篇文章中,Eysenck 为自己的做法辩护:他说,与大多数批评者不同,他仔细阅读了围绕占星术与超心理学议题积累起来的大量文献,尤其是实验研究以及由此产生的方法论与统计学问题。他认为,不能用先验判断来排除这类议题,因为科学家在作出那种斩钉截铁的断言时已经错了太多次。
David K. B. Nias 于 2016 年在 Personality and Individual Differences 期刊上发表的文章,把 Eysenck 的多次合作放在更广阔的背景下:电视暴力、异常现象、笔迹学和占星术。需要注意,现有资料库只有这篇文章的目录卡片,所以本文只转述摘要所说:文章把 Eysenck 对占星术的检验放在背景中,并谈及他随后得出的结论。不应在这段摘要之外添加任何具体数字或结论。
那场针对 1000 多名冠军的法国测试做了什么?
为了用全新数据检验该假说,一个由 Claude Benski 领导的法国研究小组对 1000 多名体育冠军进行了测试,抽样规则事先确定。1996 年公布的结果显示,火星效应无法重现。换句话说,当数据按看结果之前就已确定的规则抽取时,冠军群体中出生时火星位于关键宫的比例不再显著高于基线。
这是一个重要结果,因为它直接指向此前测试暴露出的弱点:抽样方式。当抽样规则事先固定,研究者就没有余地再按有利于假说的方向调整样本。在这样的条件下得到阴性结果,是反对原假说的有力证据。
选择偏差的论证与 Ertel 的反驳
Paul Kurtz 及其同事于 1997 年在 Journal of Scientific Exploration 上发表《Is the Mars Effect Genuine?》一文,其中论证该效应很可能是由运动员选取方式中的偏差造成的。同年,Jan Willem Nienhuys 在 Skeptical Inquirer 上发表回顾文章,认为该效应是由数据选取与剔除方式产生的统计幻觉。Nienhuys 详述了过程:Gauquelin 用来为 1967 年测试挑选冠军的那本书收录了 636 名符合条件的法国冠军;Gauquelin 索取了其中 589 人的出生数据,其余人没有确定的出生地;实际获得的有用数据为 430 例,其中 88 人属于「难找」组。在这 88 名难找者中,有 27 人,即 30.7%,出生时火星位于关键宫。
Nienhuys 还指出,1979 年 Gauquelin 公布了一份新的欧洲冠军选集,取自 Seghers 词典系列的下一部词典,并使用了相当可疑的标准:个人项目选手必须至少在欧洲赛事中获得过奖牌才算数,而足球运动员只需一次入选法国国家队即可,对于橄榄球和手球等非足球的团队项目,则需要十次以上入选国家队。而「难找」组再一次给出了高火星比例。
在为该假说辩护的一方,Suitbert Ertel 是最有力的反驳者。Nienhuys 转述说,德国占星家 Peter Niehenke 把那些所谓的行星效应称为无价的科学事件,并引用了德国心理学家 Suitbert Ertel 的话,后者曾说 Gauquelin 的发现就像历史上任何其他被证明为正确的理论性实验科学结构一样。需要注意,这是间接引用:现有资料库中还没有 Ertel 本人的文章,所以他的意见只能通过转述来源呈现,不应把那些来源没有复述的论证归到他名下。
为什么选择数据的规则必须在看结果之前就定好?
Nienhuys 提出了一个值得注意的方法论原则:统计显著性计算是一种科学赌博,只有在收集数据之前就预先规划好才有意义。他拿日常生活作比较:比赛结束后才下注,或者用一份赌注的价钱下多份赌注,都不能算公平,在这一点上科学应当和日常生活一样。
这正是整个故事的核心。当研究者被允许在看过数据之后再决定谁属于「难找」的组、谁被排除、谁被计入,那么即使最初的假设不成立,得出一个看似有意义结果的概率也会大幅上升。预先定好的选样规则,正是 Benski 等人那项法国测试所采用的,目的就是堵住这条路。
| 研究 | 年份 | 数据范围 | 结果 |
|---|---|---|---|
| Gauquelin 发表假说 | 1955 | 体育冠军(法国和欧洲) | 火星关键宫位的出生比例约 22%,背景值为 17% |
| Zelen 测试 | 1977 | Gauquelin 选出的体育冠军样本 | 总体人口背景值接近 17%;结果无法区分真实效应与数据处理错误 |
| 美国测试 | 1979-1980 | 408 位美国冠军 | 55 人,即 13.48%,出生在火星关键宫位 |
| Benski 等人的法国测试 | 1996 | 1000 多位体育冠军,选样规则预先定好 | 未能重复出该效应 |
| Kurtz 等人的文章 | 1997 | 综述与分析 | 效应很可能是选取运动员样本时的偏差造成的 |
| Nienhuys 的回顾文章 | 1997 | 综述与分析 | 因选取和排除数据而产生的统计错觉 |
独立测试走到了哪一步?
如上表所示,独立测试走向了两个不同方向。发表在 Skeptical Inquirer 上的美国测试给出的结果甚至低于背景值:408 位冠军中只有 55 人,即 13.48%,出生在火星关键宫位。如果效应是真的、且量级如 Gauquelin 所报告,这个数字本应高于 17%,而不是更低。这一结果引发了一场旷日持久的争论,Nienhuys 把它形容为关于争论的争论,几乎没完没了。
值得注意的是,1977 年的 Zelen 测试表明,总体人口的背景值确实接近 17%,也就是说该效应要么是真的,要么是数据处理错误造成的。正因为这两种可能都还敞开,才需要一项用全新数据做的全新测试,美国测试正是因此而生。
Nienhuys 还就行星假说的性质提出了一个重要观点:它们与一个非常真实的现象毫无关系,那就是优秀运动员的出生日期倾向于按季节极不均匀地分布。他引用了 Dudink 1994 年发表在 Nature 上关于出生日期与运动成绩的研究。这种季节性分布是真实存在的现象,可以用出生月份影响被选拔和训练的机会等因素来解释,与出生时火星位置的假说完全不同。火星升起可以发生在一天中的任何时候,与季节无关,这就使行星假说无法解释季节性分布现象。
为什么研究界不接受这一效应?
主流研究界不接受火星效应,主要有三个原因。第一,采用预先定好选样规则的测试,具体是 Benski 等人 1996 年的法国测试,未能重复出结果。第二,Kurtz 等人 1997 年以及 Nienhuys 1997 年的分析指出,最初的结果很可能是选取和排除数据时的偏差造成的。第三,美国测试的结果低于背景值,与假说的预测相反。
尽管如此,需要说明的是,争论并未完全结束。Suitbert Ertel 是这一假说最有力的辩护者,据各转引来源,他认为 Gauquelin 的发现与历史上任何已被证明为正确的理论性实验科学结构并无不同。这是研究界中的少数意见,而现有资料库中没有 Ertel 本人的文章,因此本文中所有对其观点的转引都是经由其他来源的间接引用。
关于数据范围有一点需要谨慎:上述测试是在法国、美国和欧洲做的,对象是不同年代的体育冠军群体。这些研究中没有一项是在越南人身上进行的,因此在没有针对越南人的研究之前,不能把结果推及越南人。
由信念产生的真实之物,就该照实称呼
还有一种可能应当恰如其分地说明:如果一个人相信出生时火星处于某个位置会给自己运动天赋,这种信念可能改变行为,而行为会改变结果。一个相信自己有天赋的人可能练得更多、更坚持、找到更好的教练,从而取得更好的成绩。这是一个由信念产生的真实效应,它并不是占星术能正确预测行星位置的证据。也不应仅仅因为它与某个信念体系相关就否认这一效应。正确的说法是:效应是真实的,但它属于心理和行为层面,不属于出生时火星的位置。
在民间,人们仍然常常相信出生的日期时辰会影响性格和命运。那是一种有文化厚度的信念,占星从业者就在它的框架内工作。本文无意从道德或文化上评价这种信念,只是说明当它的某个具体假说被拿来用统计数据检验时会发生什么。
这个故事在方法上留下了什么教训?
火星效应这个故事,是关于预先确定数据选取规则之重要性的最清晰例子之一。Nienhuys 明确提出了这条原则:只有在收集数据之前就已规划好的统计显著性计算才有意义,而比赛结束后再下注不能被视为公平。在这个案例中,正是各次检验之间取样规则的差异,造成了结果的差异。
这也说明了为什么一个最初看似显著的结果还不足以得出结论。科学需要能够重复出结果的独立检验,而当独立检验无法重复出结果时,研究界会倾向于这样的假设:最初的结果是数据的现象,而不是自然的现象。这不是 Gauquelin 作为数据工作者的失败,而是一堂关于观察数据在取样规则未被事先固定时所受局限的课。
需要强调,Gauquelin 是一位严肃的数据心理学家,他花费了数十年收集和分析数千人的出生数据。正因为他的数据足够大、足够详细,经得起检验,这个故事才成为超心理学与占星学研究史上最重要的方法论争论之一。大多数研究者的结论是:当样本按预定规则选取时,该效应站不住脚,但像 Ertel 这样的一些研究者仍然反驳这一结论,争论尚未完全结束。
