14MB的AI模型爆火:Needle 2让手机手表也能跑工具调用,今天涨447星

· 科技资讯

45M 参数、14MB 体积,塞进手机还能干正经活

GitHub Trending 日榜上,一个叫 Needle 2 的项目今天暴涨 447 星:整个模型是一个 45M 参数、14MB 的二进制文件,跑一次完整会话只占约 28MB 内存,专门为手机、手表、智能家居和机器人这类”小设备”设计。作者是 cactus-compute,模型权重开源在 Hugging Face。

14MB的AI模型爆火:Needle 2让手机手表也能跑工具调用,今天涨447星封面

先消化一下这个数字的离谱程度:主流大模型动辄几百 GB,而 Needle 2 的整个权重加推理引擎不到一张普通图片的大小。它不是玩具——在工具调用、设备使用、结构化抽取等基准上,它和 270M 的 FunctionGemma、230M 的 LFM2.5、Apple 的端侧模型”互有胜负”,而体积只有对方的 1/5 到 1/70

它解决了什么痛点

端侧 AI 一直有个死结:大模型跑不动,小模型不会干活。传统小模型只能做简单分类或补全,一遇到”帮我查天气并订个提醒”这种需要调用工具的任务就抓瞎。

Needle 2 的解法是”为工具调用而生的极简架构”:

– **工具优先**:用装饰器声明函数,模型自动决定调用哪个、参数怎么填,返回结构化 JSON,全程不联网推理
– **置信度门控**:每次输出自带校准过的置信度分数,低于阈值就主动”投降”交给云端大模型,高于阈值才自行执行
– **语法约束生成**:把你的工具 schema 编译成字节级语法,每个 token 都被约束在合法范围内,杜绝幻觉式乱填参数
– **记忆有界**:256 token 滑动窗口加工具 KV 固定,聊多久内存都稳定在 28MB 附近

这套设计的核心洞察是:在小设备上,模型不需要”什么都会”,只需要”按规矩办事”

和同类比强在哪

对比 Ollama/llama.cpp 上跑的传统小模型(如 Qwen 0.5B、Gemma 2B):那些是”通用语言模型”,跑工具调用要靠提示词硬拗,容易失败;Needle 2 是”结构化执行模型”,从架构层面保证输出合法。对比 Apple FM 这类闭源端侧方案:Needle 2 完全开源可微调。代价也很明确:它不擅长自由对话和创作,别指望它陪你聊人生——它是干活的,不是陪聊的。

上手成本与限制

安装极简,一条命令:

pip install cactus-needle

然后装饰一个函数就能跑:

import needle

@needle.tool
def get_weather(city: str):
    """Get the current weather for a city."""
    return {"city": city, "temp": 26}

model = needle.load("cactus-compute/needle2")
print(model.run("北京今天多少度?"))

适合谁:做智能家居、穿戴设备、机器人控制、离线语音助手的开发者;需要在本地快速做结构化信息抽取的团队。限制:中文能力需实测确认(模型主打英文工具场景);首次推理引擎需从 Hugging Face 下载一次,之后可完全离线。

一句话:当大模型还在卷参数量,Needle 2 选择把”会干活”压缩到 14MB——端侧 AI 的玩法,可能要变了。


🔥 关注LC智趣厅,每天推荐值得上手的开源 AI 项目。

👇 想看 Needle 2 的完整部署教程?评论区扣 1。


— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn

Scroll to Top
微信公众号:LC智趣厅

扫码关注微信公众号
LC智趣厅