Sebastian Raschka 3小时前 · 2026-09-23 01:06:31 · 2 阅读
我的 LLM 架构理解工作流
过去几个月,不少人问我如何撰写文章中的 LLM 架构草图和插图,以及我在演讲和 LLM-Gallery 里是如何处理这些内容的。我认为有必要把我的工作流记录下来,供参考。
简短的总结是:我通常从官方的技术报告入手,但现在论文的细节往往不如以前丰富,尤其是那些来自工业界的开源权重模型。
好消息是,如果模型的权重托管在 Hugging Face Model Hub 上,并且 Python transformers 库支持该模型,我们通常可以直接查看配置文件和参考实现,从而获取更多关于架构细节的信息。“能跑起来的”代码不会骗人。

我也应该说明,这主要针对开源权重模型。对于像 ChatGPT、Claude 或 Gemini 这样权重和细节均非公开的模型,这套流程基本不适用。
此外,这是一个有意保持较为手动的过程。当然,你可以将其中某些部分自动化。但如果你是想弄清这些架构的运作方式,在我看来,亲手操作几次仍是最好的练习之一。

原始来源: Sebastian Raschka