← 文章 / AI技术
Sebastian Raschka 3小时前 · 2026-09-23 01:06:31 · 2 阅读

我的 LLM 架构理解工作流

过去几个月,不少人问我如何撰写文章中的 LLM 架构草图和插图,以及我在演讲和 LLM-Gallery 里是如何处理这些内容的。我认为有必要把我的工作流记录下来,供参考。

简短的总结是:我通常从官方的技术报告入手,但现在论文的细节往往不如以前丰富,尤其是那些来自工业界的开源权重模型。

好消息是,如果模型的权重托管在 Hugging Face Model Hub 上,并且 Python transformers 库支持该模型,我们通常可以直接查看配置文件和参考实现,从而获取更多关于架构细节的信息。“能跑起来的”代码不会骗人。

图 1:该工作流的基本动机在于,现在的论文通常不够详细,而可用的参考实现提供了具体可考察的对象。

我也应该说明,这主要针对开源权重模型。对于像 ChatGPT、Claude 或 Gemini 这样权重和细节均非公开的模型,这套流程基本不适用。

此外,这是一个有意保持较为手动的过程。当然,你可以将其中某些部分自动化。但如果你是想弄清这些架构的运作方式,在我看来,亲手操作几次仍是最好的练习之一。

图 2:从宏观角度看,该工作流是从配置文件和代码出发,最终得出架构层面的洞察。
原始来源: Sebastian Raschka

评论 (0)