跳转至
课程笔记 · 03

3. 重要性采样与重加权

本课位置: 第 3/10 课。先完成前一课的推导;使用下方练习检查理解。

先修知识: 期望;正则分布

本课目标:理解下面各步的数学依据,能够手算核对例子,并说明结论依赖的条件。

1. 把计算投入放到重要区域

当被积函数只集中在狭小区域时,均匀抽样会浪费大量样本。选择归一化密度 \(q(x)\),要求在 \(f(x)\) 非零的区域都有支持。乘除同一个 \(q\) 得到

\[ I=\int f(x)dx=\mathbb E_q[f/q],\quad \operatorname{Var}_q(f/q)=\int\frac{f(x)^2}{q(x)}dx-I^2. \]

如果抽样分布遗漏一个虽小却有贡献的区域,就引入不可由增加样本消除的偏差。柯西不等式给出 \(\int f^2/q\geq(\int|f|)^2\),等号对应 \(q\propto|f|\)。当 \(f\) 非负时,理想估计量为常数;但是归一化常数恰好是未知积分。这是设计近似抽样分布的方向,而不是用未知答案定义算法。

2. 一个可精确比较的算例

取 \(f=x^2\)、区间 \([0,1]\)。均匀抽样方差为 \(4/45\)。改用 \(q=2x\),除测度为零的端点外,估计量变为 \(x/2\)。其均值为 \(1/3\),二阶矩为 \(\int_0^1(2x)(x^2/4)dx=1/8\),所以方差为 \(1/72\),比均匀抽样小 \(6.4\) 倍。若选 \(q=3x^2\) 就得到零方差,但这里归一化本来已知。这些比较来自解析积分,不是已运行的模拟。

3. 未归一化分布与比值估计量

假设链采样 \(p_0\),目标为 \(p_1\propto p_0w\)。分子分母消去未知归一化常数后

\[ \langle A\rangle_1=\frac{\langle wA\rangle_0}{\langle w\rangle_0},\qquad \widehat A_1=\frac{\sum_sw_sA_s}{\sum_sw_s}. \]

温度重加权中 \(w_s=e^{-(\beta_1-\beta_0)E_s}\)。即使分子分母各自无偏,比值在有限样本时也一般有偏。误差传播须对比值作展开并保留协方差。对于独立非负权重,\((\sum w)^2/\sum w^2\) 可诊断权重是否集中于少数样本,但它不是完整的马尔可夫链有效样本数,更不能发现从未访问的状态。

4. 分布重叠决定可用范围

如果目标温度偏好的构型在原温度下从未出现,重新加工直方图也无法产生它们。应检查能量与序参量的分布,比较独立起点,并在重叠不足时引入中间状态或扩展系综。计算指数权重可先减去最大的对数权重,避免上溢;相同比例在比值中消掉。稳定数值计算只保护已有信息,不能创造分布重叠。对相变附近的双峰分布尤其要谨慎,因为一个峰内的丰富样本仍可能漏掉另一个峰。

还有一种减小方差的方法叫控制变量。若观测量 \(B\) 的均值 \(b\) 已知,可用 \(A-c(B-b)\) 替代 \(A\),期望不变。方差为 \(\operatorname{Var}(A)+c^2\operatorname{Var}(B)-2c\operatorname{Cov}(A,B)\),对 \(c\) 求导得到最优 \(c=\operatorname{Cov}(A,B)/\operatorname{Var}(B)\)。分母须非零,系数最好用独立调参数据估计,避免在最终报告样本上选择造成有限样本效应。

5. 练习与解答

练习: 权重为 \(1,1,1,9\),计算权重集中诊断量。

解答

结果为 \(12^2/84=12/7\approx1.71\)。四个构型只相当于不足两个等权独立样本;若样本还相关或漏掉状态,实际可靠性更差。

练习: 重要性密度能否在 \(f\ne0\) 的区域为零?

解答

除非该区域贡献测度为零,否则不能。那样会遗漏积分的一部分,问题是偏差而不仅是方差大。

重要性采样与重加权

原创教学示意图;用于解释本课数学或算法结构,不是模拟或实验测量。

6. 延伸阅读与相邻课程

相关理论:分子动力学 · 量子蒙特卡洛

软件衔接:CP2K · Quantum ESPRESSO

以上软件教程提供势能、轨道或收敛管理的相关背景;不代表这些软件教程已经执行本页的 QMC 或蒙特卡洛算例。

7. 关联理论与实践

分子动力学 · 量子蒙特卡罗 · RASPA3


上一课 · 课程目录 · 下一课