DeepSeek 开源的 MoE 大模型,性能比肩顶级闭源模型,训练成本极低。
🧠 大语言模型
开源大模型与模型家族:Llama、Qwen、DeepSeek、GLM 等
DeepSeek 的推理模型,以强化学习激发长链思维能力,并开源蒸馏小模型。
阿里通义千问第三代开源模型,涵盖稠密与 MoE,支持思考/非思考模式切换。
xAI 开放的 Grok-1 权重与示例代码。
Hugging Face 对 DeepSeek-R1 的完全开源复现,含训练数据与脚本。
The official repo of Qwen (通义千问) chat & pretrained large language model proposed by Alibaba Cloud.
OpenAI 的开放权重模型仓库,含推理示例与部署指引。
线性复杂度的类 RNN 大模型架构,推理省显存、长文本友好。
面壁智能的高效端侧模型系列,小参数量、强能力,适合手机与边缘设备。
月之暗面的万亿参数 MoE 模型,擅长智能体与代码任务。
Mistral AI 官方开源模型的最小推理代码。
Transformer Explained Visually: Learn How LLM Transformer Models Work with Interactive Visualization
零一万物开源的双语(中英)大模型系列。
Meta Llama 系列模型的官方工具与模型卡仓库。
An implementation of model parallel autoregressive transformers on GPUs, based on the Megatron and DeepSpeed libraries
上海 AI 实验室的书生·浦语系列大模型,附完整工具链。
智谱 AI 开源的 GLM-4 系列对话模型,支持长上下文与工具调用。
Gemma 的轻量级 C++ 推理引擎,便于研究与嵌入。
AI2 的完全开放语言模型,连训练数据、代码与日志一并开源。
Google DeepMind 的 Gemma 开放模型库,含推理与微调示例。
百川智能开源的 Baichuan 2 系列大模型。
Hugging Face 的小而强的语言模型系列及完整训练配方。
Pure Rust implementation of a minimal Generative Pretrained Transformer
Open weights language model from Google DeepMind, based on Griffin.