WALL-E's Blog
LLMMathPrimer
分类 - LLMMathPrimer
2026
2026-07-07
大模型数学速成(09):多头注意力——多个专家各看各的
2026-07-06
大模型数学速成(08):ViT 层 vs LLM 层——概念对照总表
2026-07-05
大模型数学速成(07):RoPE——用旋转编码位置
2026-07-04
大模型数学速成(06):前馈网络 FFN——GELU 与 SwiGLU
2026-07-03
大模型数学速成(05):注意力机制与 Softmax
2026-07-02
大模型数学速成(04):LayerNorm、RMS Norm 与残差连接
2026-07-01
大模型数学速成(03):Q/K/V 投影——同一输入,三种角色
2026-06-30
大模型数学速成(02):矩阵乘法——神经网络的基本变换
2026-06-29
大模型数学速成(01):张量、维度与「列 = token」
2026-06-28
大模型数学速成(00):读 Transformer 前需要哪些数学?
1
2
WALL-E-2000
文章
169
标签
401
分类
15
Follow Me
公告
This is my Blog
最新文章
语言模型微调实战(09):部署、复盘与下一步
2026-08-10
专注时段网站拦截器:一个 Manifest V3 Chrome 扩展的设计与实现
2026-08-09
语言模型微调实战(08):提升结构化输出的泛化与可靠性
2026-08-09
语言模型微调实战(07):评估与失败分析
2026-08-08
语言模型微调实战(06):看日志与选轮数
2026-08-07
分类
AI
20
Assembly
7
Blog
3
CppInPractice
28
Docker
1
LLMMathPrimer
20
LLaMAFactorySFT
10
Life
7
标签
Hexo
背压
Token
位置编码
HashMap
OCR
标准
基础语法
协程
训练配置
Embedding
Temperature
Xcode
微调
Clippy
栈
Prompt
auto
RAII
工具库
电影
现代构建
Vim
Fine-tuning
类型推导
线程
递归
llama.cpp
Flash Attention
路由
Tokio
jthread
学习方法
因果掩码
GQA
initramfs
UTF-8
踩坑
定时任务
低秩
归档
八月 2026
12
七月 2026
86
六月 2026
41
一月 2026
1
五月 2025
7
六月 2023
1
十一月 2022
2
四月 2020
1
网站信息
文章数目 :
169
本站访客数 :
本站总浏览量 :
最后更新时间 :