📖 书目详情
从零开始写大模型:从神经网络到Transformer
| 著者 | 王双, 牟晨, 王昊怡编著 |
| ISBN | 9787302695080 |
| 中图分类 | TP18 自动化技术、计算机技术 |
| 学科分类 | 工学 |
| 版次 | 第1版 |
| 出版社 | 清华大学出版社 |
| 丛书名 | — |
| 出版年 | 2025 |
| 页码 | xi, 232页 |
| 价格 | ¥69.80 |
| 可推荐册数 | 请登录后查看 |
| 核心评分 |
8.5/10
|
📝 内容简介
本书共20章, 分为5篇。第1篇神经网络快速入门, 介绍神经网络的基础和结构; 第2篇Transformer架构基础, 介绍几种经典的编解码架构、Tokenization基础知识、Transformer架构涉及的数学概念; 第3篇Transformer模型剖析, 首先介绍大语言模型的概念和参数规模, 然后介绍Transformer的词汇输入模块、注意力机制模块和输出模块, 最后介绍基于Transformer架构的模型训练过程、推理过程、优化方法和超参数; 第4篇Transformer进阶, 首先介绍如何使用Python实现一个简单的Transformer架构, 然后介绍BERT和GPT两种经典大语言模型, 最后给出国内一些大公司的高频面试题; 第5篇GPT模型完全体验之MiniMind, 详细介绍一个开源极简大语言模型MiniMind的项目情况、代码结构, 以及安装、训练、微调与推理过程等, 帮助读者上手体验大语言模型的完整构建过程。
🏛️ 本馆馆藏信息
本馆暂无该书的馆藏记录,可在线借购