Souyer's Archive

Souyer's Archive

=Souyer的博客存档=

DATA8 CHAPTER 8

DATA8 CHAPTER 8

本文介绍了数据科学中的抽样方法与假设检验。抽样分为确定抽样、随机抽样(含放回与不放回)、系统抽样和方便抽样,其中随机抽样可用`np.random.choice`实现按比例抽取。假设检验部分涵盖模型评估、总变差距离(TVD)指标,以及A/B测试中的排列检验方法,用于比较两组样本是否来自同一分布。最后讨论了随机对照试验中的潜在结果框架,用于推断因果关系,并强调样本量对结论推广的影响。
more...
CS127 Chapter 4

CS127 Chapter 4

主成分分析(PCA)是一种数据降维方法,通过寻找标准正交向量组,使数据投影后保留最大信息量,其最优解为协方差矩阵最大特征值对应的特征向量。奇异值分解(SVD)是PCA的推广,将任意矩阵分解为旋转、缩放和旋转的组合,其构造基于对称矩阵的特征分解。低秩近似利用SVD截断保留主要奇异值,在Frobenius范数和谱范数下均能最优逼近原矩阵,实现数据压缩。
more...
CS61A Chapter 16

CS61A Chapter 16

本文介绍了结构化查询语言(SQL)的基础知识,涵盖其声明式特性、表格创建与操作、表达式运算、连接及分组聚合等核心功能,并延伸至数据库管理和Python中执行SQL的方法。文章强调SQL用于处理表格数据,语法简洁,支持从新数据或已有表构建表格,通过筛选、排序和聚合实现高效查询。最后,作者分享学习CS61A课程的感想,认为其内容精炼、资源丰富,极大拓展了编程视野,并推荐此课程。
more...
DATA8 CHAPTER 7

DATA8 CHAPTER 7

本文介绍了数据分析中的随机抽样与模拟实验方法。首先通过Python和R代码示例展示了如何从总体中进行简单随机抽样,并说明了布尔值比较及`np.count_nonzero()`统计非零项的技巧。随后阐述了模拟实验的四个基本步骤,并以抛硬币实验为例,通过20000次重复模拟验证了正面次数在50次附近呈对称分布。最后,文章用三门问题这一经典概率悖论展示了模拟实验的应用价值,通过10000次模拟证实换门可将中奖概率从约1/3提升至约2/3,直观验证了概率理论。
more...
常微分方程 Cheat Sheet

常微分方程 Cheat Sheet

本文系统梳理了常微分方程的核心理论,涵盖基本概念、一阶方程的初等解法(变量分离、线性方程、恰当方程及积分因子、隐式方程)、解的存在唯一性定理与延拓、高阶线性微分方程的一般理论及常系数解法,以及线性微分方程组的结构与求解方法,并辅以例题和公式推导。
more...
CS61A Chapter 15

CS61A Chapter 15

本文深入探讨了Scheme语言解释器的构建过程,以Python为工具,从基础的四则运算计算器入手,逐步实现完整的Scheme解释器。文章详细介绍了表达式树的构建、词法与句法分析、求值器实现及读取-求值-打印循环(REPL)等核心组件,并进一步扩展到环境帧管理、尾递归优化、数据即程序的哲学理念及宏定义等高级主题,全面展示了解释器的工作原理与实现技巧。
more...
CS61A Chapter 14

CS61A Chapter 14

本文介绍了Scheme语言的基础语法与核心特性,涵盖前缀表达式、条件语句(if、cond)、逻辑运算及begin和let等特殊形式;详细说明了define定义变量与函数、lambda匿名函数的使用方法;还讲解了pair和list复合数据类型的构建与操作,以及符号数据的引用方式。最后简要提及Turtle Graphics绘图功能,并附Python实现示例。
more...
数理统计 练习题集

数理统计 练习题集

这篇文章整理了茆诗松教材中关于统计量及其分布、参数估计和假设检验三章的习题及补充题,涵盖不放回抽样样本均值性质、经验分布函数、样本方差分布、次序统计量、卡方与t分布联系等理论证明,以及矩估计、极大似然估计、UMVUE、置信区间和假设检验等计算与应用题,并附有详细解答。
more...
DATA8 CHAPTER 6

DATA8 CHAPTER 6

本文介绍了Pandas中数据分组与表格连接的核心方法。分组操作通过`group_by`函数实现,可按单列或多列(交叉分类)对数据进行聚合统计,如计数、求和等,并可用`pivot_table`交叉表更直观地展示双变量分类结果。表格连接通过`join`方法,基于共同列将分散在不同表中的数据合并,未匹配的行会显示为`NaN`。文中提供了具体代码示例,并强调多变量分类一般不超过两个,以保证结果清晰。
more...
DATA8 CHAPTER 5

DATA8 CHAPTER 5

本文介绍了函数在数据处理中的进阶用法,重点讲解如何将函数作用于数据列。以Python的`apply`和R语言的`sapply`为例,演示了将无法直接处理数组的函数(如取较小值)应用于列的方法。随后通过经典的身高预测案例,展示了基于父母平均身高预测子女身高的过程,包括数据提取、散点图可视化、局部平均预测法及函数封装。预测结果近似呈直线,即回归线,该研究源于高尔顿的回归分析,并催生了均值回归理论。
more...