Llama
GGML organization and Llama contributors · macOS 菜单栏控制器,可运行本地 GGUF 模型和 llama.cpp 推理,并提供内置网页聊天及兼容模型 API。
介绍
Llama 是一款 macOS 菜单栏应用,可通过 llama.cpp 运行本地语言模型。它适合需要轻量控制器、模型下载、内置聊天界面以及供其他应用使用的 API 的开发者和本地 AI 用户。
模型与 API
应用会在端口 9931 启动本地服务器,并在 /v1 下提供 API 端点。它使用已安装的 llama.cpp 引擎,或为 Mac 安装预构建引擎。应用会发现兼容的现有模型,推荐适合此设备的模型,并从 Hugging Face 安装 GGUF 模型。模型按需加载,闲置时卸载。可使用内置 Web UI、兼容的聊天或编辑器客户端、编程代理,或直接发送 API 请求。0.44.0 版本还支持决策模型:/v1/systemone 端点会返回各个题目选项的概率,兼容模型会显示 Decision 标签。应用可下载可用的 DFlash 草稿头;发布者声称其生成速度比 MTP 最多快 50%,但这取决于工作负载。请求构建页面支持 OpenAI chat、OpenAI Responses 和 Anthropic 风格的请求;若所选模型支持,还可设置图像、工具和结构化输出。
安装与资源
下载官方 Llama DMG 并将应用放入 Applications,或使用 brew install --cask llama-app。当前 cask 要求使用 Apple 芯片 arm64 Mac,并运行 macOS 15 或更高版本。目录现已列出 0.44.0,但当前软件包的下载链接仍指向旧版 0.43.0 DMG(1,226,629 字节)。官方 0.44.0 Llama.dmg 发布资源为 1,257,897 字节;两者是不同的文件。模型权重和下载的推理引擎所需磁盘空间远多于此控制器。模型大小、量化方式、上下文长度和并发量会影响内存与性能需求;应用的推荐很有参考价值,但不能保证每个模型都能顺畅运行。
网络、账户与费用
推理在 Mac 上运行。下载模型或预构建引擎需要网络连接,且与本地推理相互独立。一般通过 localhost 使用无需云端推理订阅。Hugging Face 仓库可能公开,也可能设有限制;须遵守其自身的访问条款和模型许可证。此应用采用 MIT 许可,模型权重和外部工具则有各自的许可。通过 Tailscale 访问需要另行安装并登录 Tailscale 服务,并遵守其账户要求和条款。
网络暴露与实际注意事项
默认情况下,服务器只能通过这台 Mac 访问。设置中可将其绑定到 Tailscale 或当前网络。README 提醒,“This network”会绑定所有网络接口,且服务器默认没有密码;仅在可信网络中使用此模式,并避免在不属于自己的网络上同时启用代理模式。本地推理并不意味着主动启用的网络客户端或下载不会产生任何网络流量。请确认谁可以访问服务器,以及已连接的代理可以执行哪些操作。
~/.config/llama/models.user.ini 中的自定义模型覆盖项可以覆盖应用根据内存推导出的设置。修改前请保留副本,并留意被忽略选项的提示。外部客户端可能会提供含私密信息的提示词,或使用具备工具调用能力的代理;请检查其权限及生成的操作。已检查的源代码并未表明必须一概授予辅助功能或完全磁盘访问权限。仅授予访问你计划使用的模型、配置位置和工作流程所需的权限。
新版本 0.44.0 更新内容 1年1月1日 · OpenNavo 编辑
- ModelsRun decision models through /v1/systemone with option probabilities.
- EngineUpdate to b11429; switch immediately when no model is loaded.
- SettingsMerge Downloads and Command into Advanced.