读书笔记(前三章)
这篇书评可能有关键情节透露
极简版,用于以后回忆。“【】”内的是我自己的想法
关于不确定性
不确定性是所有研究与认知中不可或缺的方面,重要的是我们要对不确定性进行合理的估计。【如统计中的置信区间和显著性都可以看作是对于不确定性的一种估计】
我们经常会遇到不确定性和数据局限性的情况,但在不确定性和数据局限性的条件下得出相对可靠的结论正是遵循科学推论原则的优势。【为什么?】
什么是一个好的理论
①能够预测新事实(Lakatos),即以前没有观察过的事物
②能非常清晰地描绘出证伪条件,并且能够产生较多预期的现象(这些现象保证了我们能够用更多的数据检验理论)【想到了Ppopper关于好的理论的表述,好的理论是take risk的理论,暴露在被事实证伪的风险之中】
③简约?生物学似乎不会因为一个理论更简约而选择这个理论
科学描述的特点
①包含推论【例如从样本均值无偏估计总体均值】
②区分事物的系统性部分和非系统性部分
有关诠释(interpretation)
在提出研究问题之前,研究者应该对研究对象所在的文化进行深入的了解。只有经过很深的文化熏陶并清楚了解研究对象时,研究者才能够提出正确的问题和有意义的假设。
Geertz:对于“使眼色”行为的诠释
一个合适的诠释有利于提出一个理论假设。
模型
将现实对象的一些不太重要的特征抽象掉之后,我们就得到了一个模型。例如我做一个房地产楼盘的模型,我是不用复原楼盘的颜色、光线、内部装饰和墙壁上的灰尘的。定量研究用“变量”、“单位”及“观察值”建立模型,并且将其他研究范围之外的特征给抽象掉。
即便是对于现实的最精细的描述也是一种模型,因为任何描述都不可能一比一地复现现实,只能择取重要的部分来描述。由于模型必定是非现实的,所以模型也没有真假之分【这蕴含着对于现实世界的陈述都没有真假之分,一个有意思的哲学论点】
利用随机变量区分系统特征和非系统特征
例如,北京大学每天来家园食堂吃饭的人数比例是一个随机变量,这个随机变量的系统特征是学生的口味偏好、家园的饭菜质量、性价比、距离宿舍楼远近等等,非系统性特征可能是家园前面的路有一天因为装修而堵上,或者有一天学五被爆食品安全问题导致一部分学五的同学去家园吃等等。
我通过测量实际上每天到家园的同学的比例yi(i代表哪一天),用Y来表示每天到家园的同学的比例的随机变量。yi是实现了的变量,在现实中存在,而Y是描述性推断出来的变量,不是现实中测出来的。我们可以通过计算yi的平均值来推断Y的系统性特征,通过计算yi的方差来推断Y的非系统性特征【不就是集中趋势和离散趋势吗】【还要进一步看看关于随机变量的一系列概念是什么意思,随机试验,随机事件,概率等】
关于系统性特征和非系统性特征的两种极端立场:①完全或然的世界:其中一些非系统部分是不可能消除的、普遍存在的;②确定的世界:非系统部分仅仅是未被解释的部分,系统和非系统的区分可以由研究者界定,而只要有合适的解释变量,世界完全可以预测
但不论持有那种立场,推断的方法都是一样的:在开展分析前,研究者都需要假定所有观测结果均由非系统因素所解释。下一步的工作则是提供证据证明特定事件或过程是系统性作用的结果。对于那些无法解释的事件或过程,究竟是随机导致还是由未知解释变量所导致就成为将来的研究课题了。
注意:无偏不是说偏差不存在,而是说偏差不是由系统部分而是由非系统部分导致的
因果推断
通过反事实理解实现了的因果效应:我想要知道吃学一的饭是不是学生i拉肚子的原因,我今天吃了学一,测到今天拉肚子的概率是y1i【这是怎么测出来的?】。假如我没吃学一(这就是一个反事实),我拉肚子的概率是y0i。那么在第i个单位(也就是同学i)中,吃学一对拉肚子的“实现了的因果效应”就是y1i-y0i
但我们无法测量“实现了的因果效应”,这就是Holland(1986)所说的因果推断的根本问题。
于是,我们用随机变量来测定随机因果效应。利用之前描述推断的知识,我们可以为第i个同学没吃学一拉肚子的概率设定为Y0i,吃了拉了的概率设定为Y1i,这是两个随机变量(这意味着它有系统性和非系统的部分),Y0i是由其他所有没吃学一的同学的数据推断出来的, Y1i是由其他所有没吃学一的同学的数据推断出来的。 【这里可能有很大问题,例如这俩随机变量怎么来的不太理解,以后学】
我们定义随机因果效应就是Y1i-Y0i,其平均值就表示因果效应的系统性因素,而方差就表示因果效应的非系统性因素。
估计因果效应用到了两个假设:单位同质性和有条件独立(因变量的变化不是自变量变化的原因)【这两个不是特别懂】