要知道,我一直以来都有一个固定的 AI 处理脚本,它是我编写的一个项目——能为我的文章自动打标签、优化标题、生成概述。好处是 LLM 算是一种自然语言编程,只需用自然语言约束就可以了。但坏处是,你要知道我用的一直是 DeepSeek V4 Flash,我以为它的价格会相比 Pro 要版便宜一些。但是最近来看,DeepSeek V4 Pro 要取消了,随之而来的是全面的 DeepSeek V4.1 Flash 的替代。昨天早上收到了 DeepSeek 官方发来的涨价通知邮件,明确说明了如果在高峰时段如果使用的话,会从原本的低价格变成 1 块钱。但是我这些服务不可能在高峰时段不用,因为我必须保持至少每天双更。

我想了想,我不可能在半夜的时候发说说。你要知道不仅我的文章有打标签的过程,我的说说也有打标签的过程,那些标签全都是 AI 从数据库里面拿出来自己打的。如果一直用 DeepSeek,意味着我发说说消耗的钱更多。因为我用的是 M4 嘛,它确实是适合跑大语言模型那类的。所以我把 Ollama 重新装了回来,原因是我不知道怎么配置 llama.cpp。况且这些服务是要暴露出来给脚本用的,我早已习惯了 UNIX 那种包管理器模式。要在 MacBook 上部署这些大语言模型,就必须得挑选那些末尾有 MLX 标志的大语言模型,而不是默认的无标识大语言模型。MLX 结尾的,是官方专门为 M 芯片优化过的。

我一开始的选择就是通义千问,通义千问是我以前用过最好的一个模型,它小模型处理得比较好。但自从换到了 MacBook 上,我发现通义千问特别容易思考一大堆来占用上下文空间,最后能聊天的 Token 所剩无几。相比之下隔壁的 Gemma 在这方面就处理得比较好了:虽然说它的正确率不是很高,但最起码它不爱思考啊!这一点对我这种不喜欢浪费时间的人来说,算是一种优势。因为我只需要他能够总结我的文章,为我的文章打标签就行了。模型我选用的是 Gemma4,后缀是 e4b-mlx,实际在 Ollama 里用起来,聊天算是比较顺手的,说话也基本上比较干净一点,没出现过什么思维循环的逻辑错误:

1
2
3
4
5
6
7
8
# 第一个终端

brew install ollama
ollama serve

# 第二个终端

ollama pull gemma4:e4b-mlx

我已经把代码中所有涉及 DeepSeek V4 Flash 的部分换成了 Gemma4 的本地型号,又把所有涉及 API 地址的地方换成了 Ollama 的本地部署地址,这下终于可以放心在文章中展示代码了!换到了自己的电脑上部署,如果常开着的话会很卡。但我一般是要任务的时候才开着,对比起来相当于更加隐私,也便宜了一点点,至少不用花费这么多的钱去购买 API 使用权,这些事情我的电脑也能做到。给文章打标签、打上那些元字符,应该算是比较低频的任务。交给大语言模型偶尔使用一下,我觉得日常来说应该是够了。就比如说,这篇文章就是我使用 Gemma 打标签的第一篇,目前并没有发现啥明显的错误。