友情提示:如果本网页打开太慢或显示不完整,请尝试鼠标右键“刷新”本网页!
富士康小说网 返回本书目录 加入书签 我的书架 我的书签 TXT全本下载 『收藏到我的浏览器』

女士品茶-第10部分

快捷操作: 按键盘上方向键 ← 或 → 可快速上下翻页 按键盘上的 Enter 键可回到本书目录页 按键盘上方向键 ↑ 可回到本页顶部! 如果本书没有阅读完,想下次继续接着阅读,可使用上方 "收藏到我的浏览器" 功能 和 "加入书签" 功能!


侵涞穆呒嫌泻艽蟮牟畋穑阅谜饬秸咦隼啾仁敲挥卸啻蟀镏模阉堑背墒峭换厥拢且恢志龆ㄐ缘奈蟮肌�
尽管存在对奈曼基本观点的这些扭曲,假设检验还是成为科学研究中应用得最多的统计工具。奈曼提出的精巧数学构思,在科学的很多领域中都占有一席之地,变成了一种固定的观念。大部分的科学期刊都要求论文的作者在做数据分析时要采用假设检验方法,甚至连科学期刊之外的领域也开始这么做。美国、加拿大与欧洲的药物管理机构,纷纷把假设检验方法的使用列为对药品检查的强制性要求,就连法庭允许原告用这种方法证明自己受到就业歧视。假设检验已经渗透到统计学的所有分支学科中。
奈曼-皮尔逊的理论攀升到统计学的巅峰地位,一路上也不是没有挑战的。费歇尔从一开始就攻击它,而且在他有生之年一直在攻击这个理论。1955年,费歇尔在《皇家统计学会期刊》上发表一篇文章,题目是“统计方法与科学归纳”,而在他的最后一本书《统计方法与科学推论》(Statistical Methods and Scientific Inference)里,更进一步详述了他的看法。在20世纪60年代晚期,不久之后就出任《生物统计》期刊主编的大卫?考克斯(David Cox),发表了一篇分析清晰的文章,分析了假设检验在科学中的实际用途,同时也证明了奈曼的关于频数的解释不符合实际状况。在20世纪80年代,W?爱德华兹?戴明(W。 Edwards Deming)攻击了假设检验的整个思想,认为假设检验的整个思想都是荒谬的(第24章还会再提到戴明对统计学的影响)。年复一年,在统计学文献中一直有相关文章发表,指出在教科书中已成定格的奈曼-皮尔逊理论中发现了新的毛病。
不过,在奈曼-皮尔逊假设检验理论的神圣化过程中,奈曼本人并没有参与。早在1935年,他在《法国数学学会会刊》《bulletin de la Société Mathématique de France》上就用法文发表过一篇文章,对是否能找到最佳的假设检验方法提出严厉的质疑。在他后来的文章里,奈曼很少直接使用假设检验方法,他的统计方法通常是由理论原则导出概率分布,然后再由数据来估计参数。
其他一些人则捡取藏在奈曼-皮尔逊理论背后的观点来进一步发展。在第二次世界大战期间,亚伯拉罕?沃尔德扩展了奈曼利用维恩关于频数的定义,发展成了一个叫统计决策理论(statistical decision theory)的领域。埃里希?莱曼(Erich Lehmann)给出了用来判断一个好的假设检验可供选择的标准,后来在1959年,他还写了一本有关假设检验问题的权威性的教科书,这本书至今仍然是该领域对奈曼-皮尔逊假设检验理论描述得最完整的一部著作。
就在希特勒入侵波兰,将邪恶之幕笼罩欧洲大陆之前,奈曼就到了美国,并在加州大学的伯克利分校开始创建统计系。在那里他一直工作到1981年去世,这期间,他把该系创建成全世界最重要的学术性统计学系之一。他把一些统计学界赫赫有名的人物引入该系,同时也提拔了一些默默无闻的人,这些人正致力取得卓越的成就。例如,大卫?布莱克韦尔(David Blackwell)原来只是只身孤单地在霍华德大学(Howard University)工作,没有数理统计同行与他来往。由于他的种族原因,他一直没能在“白人”学校谋得一职,尽管他很有潜能。奈曼把他请到了伯克利。此外,奈曼还招了一位出身法国农民家庭的研究生吕西安?勒卡姆(Lucien Lecam),他后来成为世界领先的概率学家。
奈曼总是非常和善地对待他的学生和同事。他们常常津津乐道的是系里每天下午茶歇的欢乐时光,这是由奈曼主持的他与职员亲近接触的一个重要场合。他总是亲切地鼓励学生和同事谈谈自己最新的研究成果,同时很和蔼地提出他自己的思路和见解,给出评论,加入大家的讨论。他常常在下午茶歇即将结束时举起茶杯说“为尊敬的女士们!”他特别关照女士,鼓励她们在学术生涯上不断进步。在他的女弟子当中,伊丽莎白?斯科特(Elizabeth Scott)博士是较为杰出的,她与奈曼一起做研究,共同发表论文,范围从天文学到致癌物研究,甚至动物学。还有伊夫琳?菲克斯(Evelyn Fix)博士,她在流行病学的研究上有很重要的贡献。
直到费歇尔于1962年去世,奈曼一直受到这位天才的尖刻批评。奈曼每做一件事都会遭到费歇尔的批评。如果奈曼成功地证明出了费歇尔某项非常难解的叙述,费歇尔就说奈曼误解了他写的东西;要是奈曼扩充了费歇尔的某个观点,费歇尔就批评奈曼说他把好端端的理论用错了地方。对比,不论是付诸笔端,还是在私人场合,奈曼从不回应(如果我们相信奈曼同事的说法)。
在奈曼去世前的一次访谈中,奈曼说了一件发生在20世纪50年代的往事。当时他准备在一次国际研讨会上公开发开一篇用法语写的论文。当他步上讲台时,意识到费歇尔也坐在听众席上。在演讲论文时,他知道一场激辩难免,于是开始武装自己,他预计费歇尔会抓住论文里某个无关紧要的小地方,将论文和他本人攻击得体无完肤。奈曼讲完之后,等待听众提问,结果只有几个问题。费歇尔相当平和,一言未发。后来奈曼才知道,费歇尔不会讲法语。
第12章 置信诡计
当20世纪80年代出现了艾滋病(AIDS)这种传染病时,有若干问题需要回答。一旦传染源HIV(human immunodeficiency virus,即人体免疫缺损病毒)确定了,卫生官员需要知道有多少人受到感染,以便安排需要的资源来应付这种传染病。幸运的是,在此之前的20至30年所开发出来的流行病学 数学模型,在这里可派上用场。
从传染病的现代科学观点来看,某些个体病人接触到传染源,其中有些人会被传染,而在经过一段所谓的“潜伏期”之后,那些被传染的人会显现该疾病的症状。一旦被传染,这个人就会成为其他还没有被传染人的潜在传染源。我们没有办法预测谁会与传染源接触,谁会被传染,或谁会传染他人。我们所能做的,只是处理相关的概率分布,并估计这些分布的参数。
参数之一是平均潜伏期,也就是从被传染到症状产生的平均时间。就艾滋病这种传染病来说,平均潜伏期对卫生官员是特别重要的参数。他们没有办法知道究竟有多少人被传染,又有多少人最终会得上这种疾病,但如果能知道平均潜伏期,他们就能根据已经患有这种疾病的人数,估计出受感染的人数。不仅如此,由于艾滋病传染模式的不寻常特征,卫生官员拥有一组患者,并知道这组患者感染的时间和他们的发病时间。有一个小的血友病患者群体由于使用了被污染的血液制剂而感染上HIV,他们提供的数据可以用来估计平均潜伏期这一参数。
这个估计值的准确性如何?流行病学家可以说,他们使用的是费歇尔意义上的最佳估计量。因为他们所得的估计值是一致的,又是最有效的。他们甚至还可以修正可能的偏差,并宣称他们的估计值是无偏的。但是,如果我们在前面章节里指出的,我们没有办法知道某一个具体的估计是否正确。
如果我们不能够说某个估计值是绝对准确的,那么我们还有没有办法可以说这个估计值与参数的真值之间有多接近呢?这个问题的答案在于使用区间估计(interval estimate)。点估计(point estimate)是一个单一的数字。例如,我们可能利用从血友病研究那里得到的数据,估计出平均潜伏期是5。7年。而一个区间估计会这样表述:平均潜伏期在3。7年至12。4年之间。在很多情况下,有区间估计的数字就够了,因为所需要的公共政策对区间估计的两端边界值来说是一样的。但有些时候,区间估计值显得太宽了,对最小的边界值和最大的边界值需要制定不同的公共政策。根据一个很宽的区间估计值所能得出的结论是,利用已有的信息不足以做出充分的决策,应寻求更多的信息,可以通过扩大调查的范围或进行一系列其它的实验来得到。
举例来说,如果艾滋病的平均潜伏期长达12。4年,则感艾滋病毒的人当中约有五分之一的人在感染之后要存活20年以上;如果平均潜伏期是3。7年,那么几乎每一个被感染的人在20年内都会发病。这两个结果相差太大。没有任何一种最佳的公共政策可以兼顾,因此需要更多的信息。
在20世纪80年代末期,美国国家科学院(National Academy of Science)如今国内一批顶尖的科学家组成一个委员会,讨论臭氧层破洞的问题。臭氧层可保护人类不受紫外线辐射的伤害,但由于人类使用的喷雾剂中含氟氯碳化物,可能破坏外层空间的臭氧层。这个委员会(主席为约翰?图基(John Tukey),是本书第22章讨论的主角)不做是或否的二分法回答,而是决定以概率分布的形式建立氟氯碳化物对臭氧层的影响模型。于是,他们计算出了臭氧层每年平均变化的区间估计值。虽然使用的数据量不是很多,但他们发现,该估计区间的下边界值暗示,每年臭氧层将以一个较大的幅度减少,而这将使人类的生命在50年内受到严重的威胁。
区间估计现在已经普及到几乎所有的统计分析领域。当一项民意调查指出44%的一般民众认为总统干得不错时,通常会加上一个附注,说明这个数字“具有正负3个百分点的误差”。上述民意调查结果的意思是,44%被调查的民众认为总统干得不错。由于这是个随机的调查,所求的参数是全国所有的民众中认为总统干得不错的人数的百分比。由于样本的容量较小,因此一个合理的猜测是,总体的参数值应落在41%(44%-3%)与47%(44%+3%)之间。
怎样计算区间估计值?怎样解释一个敬意估计值的涵义?我们能对一个区间估计值做出相应的概率表述吗?我们有多大的把握确信总体参数的真值会落在所估计的区间里?

奈曼的解
1934年,耶日?奈曼在皇家统计学会做了一个演讲,题目是“论代表性方法的两个不同方面”(On the Two Different Aspects of the Pepersentative Method)。他的论文是关于抽样调查分析的。正如奈曼作品的一贯风格,这篇文章非常优美,导出了形式简单具直观易懂的数学表达式(当然是经过奈曼的推导之后才会如此)。但全文最重要的部分却在附录里,奈曼在这个附录中提出了一个很直接的方法,用来创建区间估计,并确定所得的区间估计值有多准确。奈曼称这个新的方法为“置信区间”(confidence intervals),而把置信区间的两端称为“置信界限”(confidence bounds)。
G?M?鲍利(G。 M。 Bowley)教授是大会的主席,起身致谢辞。他先用几段话讨论了论文的主要部分。接着就说到了附录:
我不太确定是否应该要求给出一个说明,或者直接提出质疑。论文的字里行间暗示,论文很难读懂,而我可能是被这个暗示误导的人之一(在这段话之后,他举出一个例子,表明他完全理解了奈曼提出的方法)。我只能说,从我一看到这篇论文开始,我就很认真地读它,而且昨天我还很仔细地读了奈曼博士对这篇论文的补充资料。我指的是奈曼博士的置信界限。我不太有把握地说,这里的“置信”是不是一个“置信诡计”。
鲍利接着举了一个例子说明奈曼的置信区间,然后继续说道:
这个方法真的会将我们引向深入吗?我们会比艾萨克?托德亨特(Isaac Todhunter,一位19世纪末的概率学家)知道的更多吗?它会让我们超越K?皮尔逊和埃奇沃思(Edgeworth,数理统计发展早期的先驱之一)吗?它真的会引领我们到我们所需要的地方去吗?就是说我们所从中抽取样本的总体其比重会正好落在这些界限内吗?我看并不见得,……我不知道我是否已把我的想法表达清楚了,……自从我看到这个方法,我就觉得它是个难题。其理论陈述没有说服力,除非有人能说服我,否则我还是怀疑它的有效性。
鲍利对置信区间这个新方法的疑惑,是自从置信界限的概念被提出来以后大家对它的普遍迷惑之一。显然,奈曼在推导其结果过程中所用的四行优美的微积分式子,在抽象的概率数学理论上是正确的。它也确实能算出一个概率值。但这个概率值究竟代表什么则并不清楚。数据是观测得来的,参数是固定的值(尽管是未知的),因此参数取某个特定值的概率只有两个结果,或者是100%(如果它就是那个值),或者是0(如果它根本不是那个值)。然而,一个95%的置信区间涉及的是95%的概率。这个概率指的是什么?奈曼在此绕过了这个问题,把他的创造称为置信区间,回避使用概率这个词。但是鲍利及其他同行一眼就看穿了这个手法。
费歇尔也在批判者之中,不过他没有抓住这个要点。他所讨论的内容空洞又含混,而且根本不是奈曼论文里的内容。因为费歇尔根本没有完全弄清楚区间估计值的计算过程。在他的评论里,他所指的是“信念概率”(fiducial probability),而奈曼的论文里并没有这个词汇。长久以来,费歇尔一直试图解决这个问题——怎样确定与一个参数的区间估计相关联的不确定度?费歇尔从一个很复杂的角度来解决这个问题,有点像他的似然函数。不过他很快就证明,用这种方式研究这个公式并不符合概率分布的要求。费歇尔称这个函数为“信念分布”(fiducial distribution),但他后来又违反了他自己的思路,使用了其他人在处理适当概率分布时可能会用到的相同数学方法。费歇尔所希望的结果,是从观测数据中得到参数的一组合理的值。
这也正是奈曼所得的结果,而且如果该参数为正态分布的平均数时,两个方法会得到相同的答案。据此费歇尔认为奈曼窃取了他的偏偏分布的思想,只是换了个名字而已。费歇尔对他的信念分布的研究从来没有取得进一步的发展,因为他的方法在遇到更复杂的参数(比如标准差)时就不管用了。奈曼的方法对处理任何类型的参数都是有效的。费歇尔似乎从未理解这两种方法之间的差异,直到死前他还坚持认为,奈曼的置信区间最多只是他的信念区间(fiducial intervals)概念的推广。他坚信,在碰到足够复杂的问题时,奈曼的显然是推广的方法也不会奏效——就像他自己的信念区间方法一样。

概率与置信水平
不管碰到的问题有多复杂,奈曼的方法没有失败,这也是该方法在统计分析中得到广泛应用的原因之一。奈曼置信区间中的真正问题,倒不是费歇尔所提出的那个,而是鲍利在一开始讨论时就点出来的问题,即这个方法中的概率到底指的是什么?奈曼的回答又回到了现实生活中概率的频数定义上。正如他在这篇论文里所说的(他在稍后的另一篇探讨置信区间的论文里,对这一点做了更清楚的解释),不应该从每一个结论的角度看待置信区间,而应该其视为一个过程。从长期来看,对于一直计算95%的置信区间的统计学家来说,他们将发现,在总次数中,参数的真值将有95%的机会落在所计算的区间内。请注意,对奈曼来说,与置信区间相联系的概率并不是我们“答对”的概率,而是统计学家使用某种方法从长期来看做出正确陈述的频率。这个数字与当前的估计值有多“准确”根本没有任何关系。
尽管奈曼定义这个概念时非常仔细,尽管许多像鲍利这样的统计学家也都非常小心,力图保持对概率概念的清晰理解并使其不被误用,但在科学领域中对置信区间的普遍应用却导致了许多草率的思维。举例来说,有人使用95%的置信区间来表示他有“95%的把握”保证参数的真值会落在这个区间里,这是很普遍的。我们在13章会碰到:L?J?萨维奇和布鲁诺?德费奈蒂(Bruno de Finetti),并介绍他们对个人概率的研究,他们的研究结果证明了使用上述陈述的合理性。但是,计算某人对某一件事的把握程度,与计算一个置信区间完全是两回事。统计文献里有很多文章都谈到,根据一组相同的数据,以萨维奇和德费奈蒂的方法所推导出的参数范围,和以奈曼的方法为基础推导出的置信界限,两者之间是截然不同的。
尽管在奈曼的方法中人们对概率的涵义仍存有疑问,但是奈曼的置信界限已经成为计算区间估计值的标准方法。许多文学家计算90%或95%的置信界限,而且看上去好像他们有把握认为,该区间包含了参数的真值。
时至今日,已无人再谈论或在写作中涉及费歇尔的“信念分布”的话题了。该思想已随费歇尔的去世而消失。费歇尔竭力让他的思想能发挥作用,他做了大量的相当聪明而且非常重要的研究工作,其中有些研究成果已成为当今的主流,而其它部分则仍停留在费歇尔搁笔时的不成熟状态。
在费歇尔的研究过程中,他曾有好几次差点儿就建立一门统计学业的分支学科,也就是他所称的“逆概率”(inverse probability),但每次他都半途而废。逆概率的思想起源于18世纪的一位业余数学家雷韦朗?托马斯?贝叶斯(Reverend Thomas Bayes),贝叶斯与很多同时代的顶尖科学家都有密切的书信往来,并经常提出一些很复杂的数学问题给他们。有一天,他随意玩弄一些概率的标准数学公式,用简单的代数把其中两个式子结合在一起,竟发现一些令他很惊讶的结果。
下一章,我们来谈谈贝叶斯异论(Bayesian heresy),并且看看为什么费歇尔拒绝使用这种逆概率。
第13章 贝叶斯异论
从8世纪的早期,威尼斯共和国是地中海一带的一个主要的强权国家。在其政权鼎盛时期,威尼斯控制了大部分的亚得里亚海岸,以及克里特岛和赛浦路斯岛,同时还垄断了东方通往欧洲的商业贸易路线。威尼斯共和国由一群贵族家族所统治,这些家族之间保持着某种民主的程序。整个国家名义上的领袖是总督,从公元697年该共和国成立起,到1797年被奥地利吞并,总共有150余任总督,有的任期很短,只有1年或不到1年,也有的任期长达34年。在在的总督去世之后,该共和国会遵守一项很复杂的选举程序,他们先从贵族家族的长者当中,以抽签的方式选出一小群元老,这些被选出的元老还会再挑选一些人加入到他们之中,之后再从这一扩大的元老群中以抽签方式选出一小群人。这样的程序进行几次之后,会选出一群最后的总督候选人,总督就在这群人当中产生。
在威尼斯共和国历史的早期,每阶段的抽签都要准备一批大小相同的蜡球,有的蜡球里什么都没有,有的蜡球里面却有一张小纸条,上面写着“元老”二字。到了17世纪,最后几个阶段用的道具是大小完全相同的金球与银球。公元1268年,当多杰?拉伊涅里?泽诺(Doge Rainieri Zeno)总督去世时,在第二阶段有30位元老,于是准备了30个蜡球,其中9个蜡球内藏有“元老”纸条。一个小孩被带过来,他从装有蜡球的篮子中取出一个蜡球,交给第一位元老候选人,这位元老候选人就打开蜡球,看看自己是否能够成为下一阶段的元老候选人。接着,小孩从篮子中取出第二个蜡球,交给第二位元老候选人,第二位再打开蜡球,以此类推。
在小孩选出第一个蜡球前,候选人群中的每个成员被选为下个阶段元老的概率是9/30。如果第一个蜡球是空的,剩下的候选人中每个人有9/29的概率成为下坠估摸元老。但如果第一个蜡球里有纸条,则其余人被选中的机会就剩下8/29。一旦第二个蜡球被选定且被打开,则下一个人被选中成为元老的概率同样会减少或增加,是减少还是增加取决于前次的抽球结果。这样继续抽下去,直到所有的9个纸条都被抽出为止。而在这时,剩下的候选人下一阶段成为元老的概率就降为零。
这是条件概率的一个例子。某一特定候选人被选为下一阶段元老的概率,取决于在他的选择之前被选出的蜡球。J?M?凯恩斯曾指出,所有的概率都是条件概率。用凯恩斯所举的一个例子:从他的图书室的书架上随机地选择一本书,而选中的书是精装本的概率,也是一种条件概率,其条件取决于他的图书室里究竟有多少书,以及他怎样“随机”地选取。一个病人患小细胞肺癌的概率,是以该病人的吸烟史为条件的。对一个控制实验,检验没有处理效果这一零假设所计算出来的P值,是以该实验的设计为条件的。条件概率的重要方面是,某些已知事件(例如在彩票发行过程中,某一组特定数字能赢)的概率,会随前提条件的不同而不同。
在18世纪,为处理条件概率而导出的公式都是根据以下的思想做出的,即条件事件要发生在所研究的事件之前。但是到了18世纪后期,R?T?贝叶斯在摆弄条件概率的公式时,忽然有个惊人的发现,这些公式都是内部对称的!
假设有两个事�
返回目录 上一页 下一页 回到顶部 赞(0) 踩(0)
快捷操作: 按键盘上方向键 ← 或 → 可快速上下翻页 按键盘上的 Enter 键可回到本书目录页 按键盘上方向键 ↑ 可回到本页顶部!
温馨提示: 温看小说的同时发表评论,说出自己的看法和其它小伙伴们分享也不错哦!发表书评还可以获得积分和经验奖励,认真写原创书评 被采纳为精评可以获得大量金币、积分和经验奖励哦!