标准差与标准误的差别
读一本好书,是一场精神上惬意的旅行。
读《行为科学统计精要》这本书,就如同开启了一场收获颇丰的旅行,带我去的地方,比我想要去的地方还要好。
初识这本书,是因去年准备考研,需学习统计学。
先说下自己的数学基础,小学初中,数学都是听课做题,不费心费力,老师说啥干啥,高中理科,刚开始在高一的时候数学还可以考班级前几,后面换了数学老师(新的老师不注重基础,加上偏爱难题,每次上课都讲数学最后的两道大题,于是自己基础不会,难题更不会)加上谈恋爱,对数学的不重视(自己不知道学),以至于高考数学考了90多分,刚及格而已。
大学后,专业文理兼收,大学还是偏文科,数学学的是“文科数学”且开卷考试。所以相当于没有学习。以至于连高中本就不扎实的基础都忘的差不多了。
面对统计,难免心生恐惧,但仔细思考,自己从头到尾对数学都没有发挥过主观能动性,属于算盘珠子,拨一下动一下,对数学说不上讨厌,甚至可以说有点喜欢,但对数学的认识,还属于感性认识,并未付诸实践。
从大学听闻一位老师推荐说人人都该学习一下《概率论》,自己很认同,但并未付诸实践,还是每天晃悠依旧。
而真的开始心理学考研的学习了,数学依旧是重要的基础。
刚开始自己是这样学习的,先上心理统计学的网课,然后读书,读的是心理学312统考的张厚粲老师的《现代心理与教育统计学》这本书,并做书上例题,(做例题的时候十分辛苦,数据大多未经处理,计算需要花费很长时间)但依旧不太容易理解,不理解,加上练习不够,超级容易遗忘。同时还看了甘怡群老师的《心理与行为科学统计》,这本书的例题,数据经过了处理,计算起来比较方便些。
但读书读了一轮后,依旧迷迷糊糊,看网上的言论说,所谓心理学的统计学,就是工具,我们会用即可,又不用推导公式,把公式背住,并且分清楚运用的情境,会用即可。
哇,会用即可。这四字,说来轻巧,自己也感到轻巧,但用的时,总“不小心用错”,因未理解,死记硬背罢了。
到考研初试的时候,实统测的计算题,自己算是全蒙(自己懒啊,不理解背公式,容易忘,用得少了,也与实际所用情景无法匹配),最后凭运气选,凭实力没考上。
但我没放弃统计,在读《行为科学研究方法》这本书时,对如何做心理学研究有了一个宏观的“先行组织者”,也就是大框架。继而读的《行为科学统计精要》这本书,就像一位学识渊博的学者,深入浅出循序渐进的讲解,解答了我许久未明的疑惑。
统计必不可少,是有力的工具。我们用普发教社的理论为指导,现实生活也好,原先的文献研究也好提出问题与假设,用实验的方法,经过测量得到数据,再经过描述统计组织,整理数据,推论统计,用样本的数据回答总体的问题,验证假设。科学的研究,是可证伪的,可重复的,以理论为起点,通过研究又回到理论,充实或者验证理论。在此基础上,心理学生生不息在发展,一点一点的站在前人的肩膀上,将心理学的研究向前推一点,再推一点。
很多时候,我们无法获得研究的总体,只能获得总体的一个代表性的样本,若我们要研究青少年的自我同一性获得的情况,我们研究的是某中学300名随机抽取的青少年自我同一性的获得情况,总体是所有的青少年的自我同一性的获得的情况,我们要研究总体,颇费功夫,且难以开展。而我们实际研究的某中学300名青少年自我同一性的获得情况。就是总体的一个代表性样本。
那么问题来了,我们如何确定这个样本代表总体的准确性呢?我们可以从总体获得的样本如此之多,比如我们还可以研究其他另一个中学的300个青少年,亦或者,在同一所中学,每次抽取的青少年的组成也是不同的。我们如何知道这些样本在多大程度上代表总体呢?
这就需要标准误这个概念了。
而说起标准误,我们需要先了解下标准差是啥。
标准差,是数据到平均数的标准距离,能够说明一组数据的变异情况。标准差大,一组数据到平均数的标准距离大,这组数据的分布就比较分散,标准差小,则说明一组数据到平均数的标准距离小,数据较为集中。举个极端点的例子,标准差为0,也就是一组数据中,到平均数的标准距离为0,那这组数据,就是平均数,也就是相同的数据,没有产生任何变异。
标准误则是一组数据的均值与总体均值的变异情况的衡量。一组数据的均值,是通过一组数据(我们得到的原始数据)的计算得出,叫做样本统计量。换言之,标准误就是样本在多大程度上代表总体的指标。
我们都知道,总体作为青少年,一个青少年的代表性,要弱于10个青少年的代表性,而100个青少年,就有更强的代表性。(随机抽样哇,青少年的自我同一性的获得),也就是说,我们样本容量越大,获得的统计量的代表性就越强。
而如果总体本就分布离散,变异较大,那样本统计量的代表性也会减小。就如总体为中国人的自我同一性的获得,总体本身比起之前研究总体,青少年的自我同一性的获得变异要大,获得的样本统计量的代表性也会相应变小。
那,标准差和标准误的差别在哪里呢?
标准差描述的是一组数据到平均数的标准距离。也就是一个数在多大程度上能代表这组数。
标准误描述的是一个样本均值到总体均值的标准距离,也就是样本能在多大程度上代表总体,样本越大,代表性越强,样本均值的分布越集中在总体均值附近。一个极端情况,如果样本中,数据为一,也就是一个数据,就是一个样本,那么样本均值,就是这个数本身,样本均值的分布,等同于总体分布。
所以,标准误的最大值,是标准差,也就是一个数据当做一个“样本”,让其代表总体,那样本中的数据到总体均值的距离,等同于总体中的数据到总体均值的距离。随着样本量的增大,样本均值的代表性也增大,样本均值的分布,总是围绕总体均值,变异减小。(1个数的平均数的代表性与100个数的平均数的代表性相比,后者更具代表性)
所以,我们可以把标准差当作样本量为1的样本到总体均值的标准距离。
在行为科学的研究中,知道样本多大程度代表总体,是一个怎样也绕不过的课题。