-
Transformer 初探:Q/K/V 到底在算什么
self-attention 的几何直觉;softmax 权重的含义;多头注意力与 RoPE 位置编码。
-
CS229 学习笔记:从线性回归到广义线性模型
为什么损失函数与最大似然是同一枚硬币;正规方程 vs 梯度下降;指数族与 GLM 的统一视角。
self-attention 的几何直觉;softmax 权重的含义;多头注意力与 RoPE 位置编码。
为什么损失函数与最大似然是同一枚硬币;正规方程 vs 梯度下降;指数族与 GLM 的统一视角。