本周 6 月 30 日,美团正式发布了 LongCat-2.0,并宣布对外开源。
API 使用价格目前打折(每百万 token):输入缓存未命中 2 元,缓存命中 0.04 元,输出 8 元。

LongCat-2.0 有 1.6T 总参数,平均激活约 48B,支持 100 万 token 上下文。新用户实名注册后,可以领 1000 万 token 的免费额度。
我也是马上注册了尝尝咸淡,我以为 1000 万 token 很快就用完了,但实际这个额度比看起来耐用不少。
因为 LongCat 有独特的计算 token 机制,命中缓存的 token 不算进消耗里。真正扣额度的,主要是没有命中缓存的输入,以及模型输出token。

如果你在同一个项目里反复改代码、查数据、跑一批相似任务,它不会每次都从头算一遍。很多上下文能复用,额度就会撑得很久。
我自己的体感也是这样。确实很经用。

(1000 万的额度实际我用了 1.3E token)
写代码可以,复杂指令会偷懒
LongCat-2.0 写代码是能用的。
不过我自己的使用体感,它的指令遵循和复杂推理不算好。
尤其是信息比较长的时候,它有点容易“偷懒”。比如你给它一段代码,或者一段报错。真正关键的条件在最后,它有时扫到前面,就觉得自己已经拿到足够信息了,然后直接开始处理。
结果就是,它会绕开后面那个真正重要的条件。
我有一个腾讯文档的 skill。一般模型我会直接说“把你收集到的信息写到腾讯文档上”。模型识别到 skill 之后,就会调用对应能力,把文档放到腾讯文档里。
LongCat-2.0 在这个场景里就不太行。
它会说自己没找到,不知道怎么挂载到腾讯文档上。
上下文里其实已经有相关能力了,但它没有自己识别出来。
它更适合当一个便宜的工程助手。有整理数据、补信息、写测试脚本的活,都可以先丢过去让它先跑一遍,先补一版,先整理一批东西。
整理数据这种活,它做得还行
我有一个标讯爬取工具,用于我做 AI 项目的标讯数据分析。

这类数据经常会有小问题。比如一开始爬取的时候,有些字段没爬完整。有些数据是问题数据,标签信息可能是 0,或者某些补充信息缺失。
这种活交给 LongCat-2.0,反而挺合适。
它不需要做很复杂的产品判断,也不需要理解一整个大项目的架构。任务目标很具体,就是帮我把缺失的信息补齐,把明显异常的数据找出来,把能整理的字段整理好。
这类信息补充任务,它完成得还不错。

(longcat 在检查我数据情况后给出的问题解决方案)
我觉得这就是 LongCat-2.0 比较舒服的位置。
写写代码,编辑编辑数据,整理一批结构化信息,做一些打下手的活。没问题。
让它直接接管复杂项目,就有点难。
全国产卡推理
LongCat-2.0 另一个值得看的点,是它完全在国产卡上完成训练和推理。
美团技术博客里说 LongCat 团队从 2023 年开始做国产算力适配,从千卡规模一路扩到五万卡集群,最后完成了万亿参数模型的全流程训练与推理。
这件事咱们不能只理解成“用了国产卡”。
大模型训练里有很多底层工程问题。算子要适配,通信要优化,集群要稳定,训练过程中还要处理各种硬件故障和数值问题。
而 LongCat 团队在全国产卡环境把月均日故障率降低了 70% 以上,训练 MFU 提升了 1.5 倍,稳态日吞吐超过 1T tokens/day。

我的评价
我不会把 LongCat-2.0 当成处理复杂推理和复杂项目的通用型大模型。
但它适合打零工。
写小段代码,修简单问题,补数据,整理字段,做第一轮信息清洗,帮你把一批重复工作先跑掉。尤其是在缓存机制加持下,它用起来确实不心疼。
如果你手上有很多“交给高价模型有点浪费,自己做又嫌烦”的任务,可以试试 LongCat-2.0。
但别把它放到错误的位置。
它适合当下手,不适合当总工。
以上就是这次的侦察。
如果对你有用,顺手点个赞 +「♥️」。
想第一时间收到前线情报,关注「硅基斥候S01」。我们,下次侦察见。

