Heretic:全自动去除大模型审查的开源命令行工具
Heretic 是一个开源的命令行工具,作用是在不重新训练模型的前提下,自动去掉大语言模型内置的审查限制。
本地大模型与推理引擎
Heretic 是一个开源的命令行工具,作用是在不重新训练模型的前提下,自动去掉大语言模型内置的审查限制。
一个应用覆盖语音克隆、听写与 Agent 语音输出 全部本地运行,声音数据不出机器
自托管版 ChatGPT:给本地大模型配上完整聊天界面 支持多模型接入、RAG 知识库问答、工具调用与团队权限管理,数据全程留在自己服务器
开源 AI 音乐生成模型:给歌词和曲风就能输出带人声与伴奏的完整歌曲 符号规划路线:先写乐谱再合成声音,可查看、试听、手动修改 WildSongBench 评测综合得分超过 Suno v5/v6,开源模型进入第一梯队
一条命令把 PC、Mac 或 Linux 主机变成私有 AI 服务器 自动识别显卡与内存、自动挑选模型,两分钟开始对话
用一套 OpenAI 兼容 API 覆盖智能体所需的向量检索、文档转 Markdown、结构化输出、内容安全与回答生成等全部模型任务。
全球最大的开源 AI 提示词库,16.87 万 star 覆盖 ChatGPT、Claude、Gemini 等主流 AI 助手,支持自托管部署
edge0 用 SSD 当外挂内存,让 24GB 内存的 Mac mini 跑起 35B 混合专家大模型 实测解码 14.9-17.7 token/秒,Apache-2.0 开源,目前约 1100 star
LTX-2 是能直接生成带同步声音视频的开源 AI 模型,推理与训练代码一并开放 22B 参数、约 66GB 权重,支持 LoRA 微调与 ComfyUI 集成
Datawhale 与 RadixArk 联合推出的免费开源课程,带你从零手写 LLM 推理引擎 四段式路线:基础概念、手搓 mini-sglang、源码精读、参与开源,零 GPU 也能起步
Ollama 官方上线 Claude Desktop 网关接入:三步配置即可在客户端里混用本地与开源模型,数据默认不出本机
一个命令在本地运行开源大模型,数据不出电脑 2026 年 7 月宣布服务 890 万开发者、融资 8800 万美元,8 月底推出按 token 计费的商业套餐
2.78 万亿参数的 Kimi K3 跑进 64GB 笔记本,实测约 0.6 token/s MoE 按需加载 + 3-bit 量化:把硬盘当内存用,普通电脑也能本地跑超大模型
Anthropic 官方开源提示工程课程:9 章教程加配套练习 从基础提示结构到防幻觉实战,练好给 AI 下指令的基本功
SGLang 是目前最主流的开源大模型推理引擎之一 官方称全球超 40 万块 GPU 正用它跑生产环境
面向手机与穿戴设备的混合边缘-云端 AI 引擎 4bit 量化在 iPhone 17 Pro 上实现 37 tokens/s 解码、峰值内存 644MB 量化、内核优化、云卸载三件套的实测数据与上手路径
Magnitude 是一款开源推理服务器:自动分析硬件、推荐并下载适配的本地模型,一条 CLI 向导即可接入 AI 编码 Agent,模型与数据全程留在本机。
腾讯朱雀实验室开源的一站式 AI 红队平台,Apache-2.0 覆盖 AI 基础设施漏洞扫描、MCP 与 Agent 技能扫描、越狱评估与 OpenClaw 安全扫描
Google Research 发布时序基础模型 TimesFM 3.0,原生支持多变量预测与协变量 在 fev-bench、TIME Benchmark、GIFT-Eval 三大公开基准均排名第一 3.0 权重改用非商用许可,商业落地建议选用 2.5 及以下版本
Google Research 发布时序基础模型 TimesFM 3.0,在 fev-bench、TIME Benchmark、GIFT-Eval 三大基准均排名第一 首次原生支持多变量预测与协变量输入;3.0 预训练权重改用非商用许可,商用请选用 2.5 及以下版本
腾讯微信视觉团队开源多模态嵌入模型家族 WeMM-Embedding:2B/4B/9B 三档尺寸,一套模型统一编码文本、图像、视频与视觉文档,MMEB-v2/v3 双榜公开权重最高平均分,支持 Matryoshka 维度裁剪,Apache-2.0 许可。
在本地 GPU/NPU 免费私密运行多模态 AI 的开源服务器,兼容 OpenAI/Anthropic/Ollama API。
在 Apple Silicon Mac 上自建本地 LLM 推理服务器 分层 KV 缓存、多模型同服、兼容 OpenAI 与 Anthropic API
把 OpenAI、Claude、Gemini 等多家模型 API 聚合成统一网关,集中处理权限、计费与用量统计
把 34 家提供商的免费大模型额度聚合到一个 OpenAI 兼容端点,每月约 74 亿 token 自动路由、密钥加密存储、模型目录每日更新,支持 18 种客户端一键接入
百度开源的文档解析模型 Unlimited-OCR,用一次推理直接输出超长文档的结构化结果 MIT 许可,支持 vLLM / SGLang 部署,GitHub 约 24.5k star
用约 2GB 内存预算把 26B 级 Gemma 4 MoE 模型跑在 8GB Apple Silicon Mac 上:常驻共享核心 + SSD 流式加载专家 Swift + Metal 手写的单模型专用运行时,提供 Mac 原生 App / CLI / OpenAI 兼容本地 Server 三种使用方式
把本地运行开源大模型的安装、拉取与启动压缩成一条命令,自带 REST API 与官方客户端,并提供 ollama launch 把本地模型接入 Claude Code、Codex 等编码 Agent。 179.4k star、17.6k fork,MIT 许可,Go 编写,推理引擎基于 llama.cpp,v0.32.15 于 2026-08-19 发布。
纯 C 实现、运行时零依赖的开源推理引擎,把 744B 参数的 MoE 模型 GLM-5.2 跑在 25GB 内存、无独立 GPU 的消费级电脑上——专家权重按需从 NVMe 磁盘流式加载,常驻内存仅约 9.9GB,实测可在 3 种硬件形态间切换。
把约 350 家 AI 提供商的免费额度聚合到一个本地网关 一个 auto 模型名完成自动路由,配额耗尽自动切换,无需配置任何 API Key