jingyaogong/minimind: 🧠 Train a 64M-parameter LLM from scratch in just 2h!
Why CEREBRO kept it
Train 64M LLM in 2h, trending repo
The text below is an automated extraction of the article at https://github.com/jingyaogong/minimind, stored verbatim in the public cerebro-vault repository. Copyright remains with the original publisher (github.com).
中文 | English - 此开源项目旨在完全从 0 开始,仅用 3 块钱成本与 2 小时训练时间,即可训练出规模约为 64M 的超小语言模型 MiniMind。 - MiniMind 系列极其轻量,主线最小版本体积约为 GPT-3 的 $\frac{1}{2700}$ ,力求让普通个人 GPU 也能快速完成训练与复现。 - 项目同时开源了大模型的极简结构与完整训练链路,覆盖 MoE、数据清洗、预训练(Pretrain)、监督微调(SFT)、LoRA、RLHF(DPO)、RLAIF(PPO / GRPO / CISPO)、Tool Use、Agentic RL、自适应思考与模型蒸馏等全过程代码。 - MiniMind 同时拓展了视觉模态模型 MiniMind-V、多模态 Omni 模型 MiniMind-O、扩散语言模型(MiniMind-dLM)、线性模型(MiniMind-Linear),详见 Discussion。 - 项目所有核心算法代码均从 0 使用 PyTorch 原生实现,不依赖第三方库提供的高层抽象接口。 - 这不仅是一个大语言模型全阶段开源复现项目,也是一套面向 LLM 入门与实践的教程。 - 希望此项目能为更多人提供一个可复现、可理解、可扩展的起点,一起感受创造的乐趣,并推动更广泛 AI 社区的进步。 注:本项目基于 Apache 2.0 协议开源,完全免费。
Backlinks
Appeared in 1 briefing