2025 年最值得关注的 10 个开源 AI 项目
从模型训练到 Agent 框架,从向量数据库到推理优化——本文精选 2025 年最活跃、最有影响力的 10 个开源 AI 项目,涵盖 LLM、多模态、RAG、Agent 和基础设施五大方向。
目录
一、大语言模型
1. DeepSeek-V3 / R1
GitHub: deepseek-ai/DeepSeek-V3 ⭐ 85k+
2025 年初 DeepSeek R1 的发布震惊了整个 AI 界——一个推理能力比肩 OpenAI o1 的开源模型,训练成本据报仅约 600 万美元。它的 MoE(混合专家)架构在保持推理质量的同时大幅降低了推理成本。
为什么值得关注:
- 完整开源权重,可本地部署
- MoE 架构,推理成本极低(每百万 Token 约 ¥1-4)
- 中文理解能力业界领先
- 活跃的社区生态(LoRA 微调、量化版本丰富)
# 使用 DeepSeek API(兼容 OpenAI SDK)
from openai import OpenAI
client = OpenAI(
base_url="https://api.deepseek.com/v1",
api_key="your-key"
)
response = client.chat.completions.create(
model="deepseek-chat",
messages=[{"role": "user", "content": "解释 MoE 架构的原理"}]
)
print(response.choices[0].message.content)
2. Qwen 3(通义千问)
GitHub: QwenLM/Qwen3 ⭐ 55k+
阿里开源的 Qwen 系列在 2025 年已经进化到第三代,支持文本、图像、音频、视频的多模态理解。Qwen 3 的亮点在于"原生多模态"——不是外挂视觉编码器,而是从预训练阶段就融合了多模态数据。
特点:
- 原生多模态(文本 + 图像 + 音频 + 视频)
- 多种尺寸(0.5B 到 72B),适合不同场景
- 支持 128K 上下文窗口
- 丰富的工具调用(Function Calling)能力
二、多模态模型
3. Stable Diffusion 4
GitHub: Stability-AI/generative-models ⭐ 40k+
Stable Diffusion 4 带来了革命性的提升:支持原生 4K 分辨率输出、精确的文字渲染、以及基于 ControlNet 的精确构图控制。与 Midjourney 的闭源路线不同,SD4 继续保持完全开源。
核心能力:
- 原生 4K 分辨率生成
- 精确文字渲染(终于可以生成带正确文字的图片了)
- ControlNet 生态完善(姿态、深度、线稿控制)
- LoRA 微调社区活跃
4. WhisperX
GitHub: m-bain/whisperX ⭐ 15k+
OpenAI Whisper 的增强版本,解决了原版 Whisper 的两个最大痛点:时间戳不准和无法区分说话人。WhisperX 集成了语音活动检测(VAD)和说话人分离(Speaker Diarization)。
import whisperx
# 加载模型
model = whisperx.load_model("large-v3", device="cuda")
# 转录 + 对齐时间戳
audio = whisperx.load_audio("meeting.mp3")
result = model.transcribe(audio)
result_aligned = whisperx.align(result["segments"], model, audio)
# 说话人分离
diarize_model = whisperx.DiarizationPipeline(device="cuda")
diarize_segments = diarize_model(audio)
result_with_speakers = whisperx.assign_word_speakers(diarize_segments, result_aligned)
三、RAG 与向量检索
5. Milvus 3.0
GitHub: milvus-io/milvus ⭐ 32k+
Milvus 3.0 是一个全面的架构升级:引入 GPU 索引加速(相比 CPU 快 10-50 倍)、分布式多模态向量支持、以及原生的全文+向量混合搜索。
为什么选 Milvus:
- 云原生架构,支持 Kubernetes 部署
- GPU 加速索引构建
- 混合搜索(向量 + 标量过滤 + 全文)
- 十亿级向量规模生产验证
from pymilvus import MilvusClient, DataType
client = MilvusClient("milvus_demo.db")
# 创建支持混合搜索的 Collection
client.create_collection(
collection_name="docs",
dimension=1024,
enable_dynamic_field=True,
index_params={"index_type": "GPU_IVF_FLAT", "metric_type": "COSINE"}
)
# 混合搜索:向量相似度 + 关键词过滤
results = client.search(
collection_name="docs",
data=[embedding],
filter='category == "AI" and date > "2025-01-01"',
output_fields=["title", "url"],
limit=10
)
6. Dify
GitHub: langgenius/dify ⭐ 65k+
Dify 是目前最活跃的开源 LLM 应用开发平台。它提供了可视化的 Prompt 编排、RAG 管道、Agent 能力和对话流设计,让非技术人员也能构建 AI 应用。
核心能力:
- 可视化 Workflow 编排(拖拽式)
- 内置 RAG 管道(文档上传 → 切片 → 向量化 → 检索)
- 多模型支持(OpenAI、Claude、DeepSeek、本地模型)
- Agent 工具链(搜索、代码执行、API 调用)
- 对话日志与分析
四、AI Agent 框架
7. LangGraph
GitHub: langchain-ai/langgraph ⭐ 12k+
LangGraph 是 LangChain 团队推出的基于有向图的 Agent 框架。相比 LangChain 的线性 Chain,LangGraph 允许精确控制 Agent 的每一步执行流程——包括循环、条件分支和并行执行。
from langgraph.graph import StateGraph, END
from typing import TypedDict
class AgentState(TypedDict):
messages: list
next_step: str
result: str
def think(state: AgentState) -> AgentState:
"""LLM 推理节点"""
response = llm.invoke(state["messages"])
return {"messages": [response], "next_step": "act"}
def act(state: AgentState) -> AgentState:
"""工具调用节点"""
last_msg = state["messages"][-1]
if hasattr(last_msg, "tool_calls"):
for tc in last_msg.tool_calls:
result = execute_tool(tc)
state["messages"].append(result)
return {"next_step": "decide"}
def decide(state: AgentState) -> str:
return "act" if state.get("need_tool") else END
# 构建图
graph = StateGraph(AgentState)
graph.add_node("think", think)
graph.add_node("act", act)
graph.add_conditional_edges("think", decide)
graph.set_entry_point("think")
app = graph.compile()
8. CrewAI
GitHub: crewAIInc/crewAI ⭐ 28k+
CrewAI 专注于多 Agent 协作——模拟一个团队中不同角色的分工合作。每个 Agent 有自己的角色、目标和工具,通过顺序或层级流程协同完成任务。
典型场景:
- 内容创作流水线(研究员 → 撰稿人 → 编辑)
- 代码审查团队(安全专家 + 性能专家 + 风格检查)
- 数据分析 pipeline(数据清洗 → 分析 → 可视化 → 报告)
五、推理与部署基础设施
9. vLLM
GitHub: vllm-project/vllm ⭐ 48k+
vLLM 已成为开源 LLM 推理的事实标准。2025 年底的版本支持了 FP8 量化、多 LoRA 热切换、推测解码(Speculative Decoding)和跨 GPU 的张量并行。
为什么快:
- PagedAttention:将 KV Cache 分页管理,内存利用率提升 2-4x
- 连续批处理(Continuous Batching):动态合并请求
- 量化支持:FP8、INT8、GPTQ、AWQ
- 多 LoRA 热切换:无需重启即可切换微调适配器
# 一行命令启动 DeepSeek-V3 推理服务
python -m vllm.entrypoints.openai.api_server \
--model deepseek-ai/DeepSeek-V3 \
--quantization fp8 \
--tensor-parallel-size 4 \
--max-model-len 8192 \
--enable-lora \
--max-loras 10
10. Ollama
GitHub: ollama/ollama ⭐ 120k+
Ollama 让本地运行大模型像 docker run 一样简单。一条命令下载并运行任何模型,自动处理量化、GPU 加速和 API 服务。
# 一行命令运行 DeepSeek-R1
ollama run deepseek-r1:8b
# 自定义 Modelfile
FROM llama3
SYSTEM "你是一位 Python 专家"
PARAMETER temperature 0.5
六、工具与开发辅助
Unsloth:模型微调加速器
GitHub: unslothai/unsloth ⭐ 20k+
在开源大模型生态中,微调是让通用模型适配特定场景的关键环节。Unsloth 是目前最流行的模型微调加速库,通过手动优化的 CUDA Kernel 和内存管理策略,能将 LoRA / QLoRA 微调速度提升 2-5 倍,GPU 显存占用降低 50-80%。
为什么值得关注:
- 2-5 倍微调加速,显存占用大幅降低
- 支持 Llama、Mistral、DeepSeek、Qwen 等主流模型
- 与 Hugging Face Transformers 生态无缝集成
- 免费 Colab Notebook 一键微调
- 活跃的社区和持续的模型适配更新
# Unsloth 微调示例 — 几行代码完成 LoRA 微调
from unsloth import FastLanguageModel
import torch
# 加载 4-bit 量化模型(显存降低 ~4x)
model, tokenizer = FastLanguageModel.from_pretrained(
model_name="unsloth/DeepSeek-R1-Distill-Llama-8B",
max_seq_length=2048,
load_in_4bit=True,
)
# 添加 LoRA 适配器
model = FastLanguageModel.get_peft_model(
model,
r=16, # LoRA rank
target_modules=["q_proj", "k_proj", "v_proj", "o_proj",
"gate_proj", "up_proj", "down_proj"],
)
# 现在可以用标准 Hugging Face Trainer 进行微调
七、选型建议
| 场景 | 推荐项目 | 理由 |
|---|---|---|
| 本地运行 LLM | Ollama | 最简单,一条命令 |
| 生产推理服务 | vLLM | 性能最优,吞吐最高 |
| 构建 AI 应用 | Dify | 可视化,低代码 |
| 多 Agent 协作 | CrewAI | 角色扮演清晰 |
| 精确流程控制 | LangGraph | 状态图,灵活 |
| 向量检索 | Milvus | 十亿级验证 |
| 语音处理 | WhisperX | 说话人分离 |
| 模型微调 | Unsloth | 2-5x 加速 |
总结
2025 年的开源 AI 生态已经相当成熟——从模型训练到生产部署,从单 Agent 到多智能体协作,每个环节都有优质的开源方案。选择项目时建议关注三个指标:
- GitHub Stars 增长趋势(活跃度)
- Issue 响应速度(维护质量)
- 商业 adopters 数量(生产验证)
开源 AI 不再是"备选方案",而是越来越多企业的首选。成本可控、数据安全、灵活定制——这三个优势在 2025 年变得更加突出。
本文基于 GitHub 公开数据整理,数据截至 2025 年 12 月。Stars 数为近似值。