WALL-E's Blog

LLMMathPrimer

分类 - LLMMathPrimer
2026
大模型数学速成(09):多头注意力——多个专家各看各的
2026-07-07
大模型数学速成(09):多头注意力——多个专家各看各的
大模型数学速成(08):ViT 层 vs LLM 层——概念对照总表
2026-07-06
大模型数学速成(08):ViT 层 vs LLM 层——概念对照总表
大模型数学速成(07):RoPE——用旋转编码位置
2026-07-05
大模型数学速成(07):RoPE——用旋转编码位置
大模型数学速成(06):前馈网络 FFN——GELU 与 SwiGLU
2026-07-04
大模型数学速成(06):前馈网络 FFN——GELU 与 SwiGLU
大模型数学速成(05):注意力机制与 Softmax
2026-07-03
大模型数学速成(05):注意力机制与 Softmax
大模型数学速成(04):LayerNorm、RMS Norm 与残差连接
2026-07-02
大模型数学速成(04):LayerNorm、RMS Norm 与残差连接
大模型数学速成(03):Q/K/V 投影——同一输入,三种角色
2026-07-01
大模型数学速成(03):Q/K/V 投影——同一输入,三种角色
大模型数学速成(02):矩阵乘法——神经网络的基本变换
2026-06-30
大模型数学速成(02):矩阵乘法——神经网络的基本变换
大模型数学速成(01):张量、维度与「列 = token」
2026-06-29
大模型数学速成(01):张量、维度与「列 = token」
大模型数学速成(00):读 Transformer 前需要哪些数学?
2026-06-28
大模型数学速成(00):读 Transformer 前需要哪些数学?
12
avatar
WALL-E-2000
文章
170
标签
403
分类
15
Follow Me
公告
This is my Blog
最新文章
Needle 2 技术分析:一个 14 MB 的端侧 Tool Call 引擎
Needle 2 技术分析:一个 14 MB 的端侧 Tool Call 引擎2026-08-18
语言模型微调实战(09):部署、复盘与下一步
语言模型微调实战(09):部署、复盘与下一步2026-08-10
专注时段网站拦截器:一个 Manifest V3 Chrome 扩展的设计与实现
专注时段网站拦截器:一个 Manifest V3 Chrome 扩展的设计与实现2026-08-09
语言模型微调实战(08):提升结构化输出的泛化与可靠性
语言模型微调实战(08):提升结构化输出的泛化与可靠性2026-08-09
语言模型微调实战(07):评估与失败分析
语言模型微调实战(07):评估与失败分析2026-08-08
分类
  • AI21
  • Assembly7
  • Blog3
  • CppInPractice28
  • Docker1
  • LLMMathPrimer20
  • LLaMAFactorySFT10
  • Life7
标签
观影 Mac 汇编 optional DFS merge_lora Workspace YOLO LangChain CLI llama.cpp 函数调用 路由 DPO JSONL Unix MCP API 因果掩码 Semaphore 快捷键 数据集 Chrome 扩展 reset NASM Tokenizer BFS Actor GoogleTest FastAPI 调试 Sync 开发工具 异步 哈希表 内核 Result 同步 标准库 背压
归档
  • 八月 2026 13
  • 七月 2026 86
  • 六月 2026 41
  • 一月 2026 1
  • 五月 2025 7
  • 六月 2023 1
  • 十一月 2022 2
  • 四月 2020 1
网站信息
文章数目 :
170
本站访客数 :
本站总浏览量 :
最后更新时间 :
© 2025 - 2026 By WALL-E-2000框架 Hexo 8.1.2|主题 Butterfly 5.5.5