2600 tokens / s:Meta 发布 Llama API,携手 Cerebras 打造最快 AI 推理解决方案

图灵汇官网

Meta公司在首次举办的LlamaCon大会中,除了发布独立的AI应用程序外,还推出了名为Llama API的服务。目前,这一服务正以免费试用的方式向开发者开放。根据相关报道,这款API允许开发者测试最新版本的Llama 4系列模型,包括Llama 4 Scout和Llama 4 Maverick。同时,它还提供便捷的API密钥生成功能,并附带了轻量级的TypeScript和Python开发工具包。

开发者只需几步就能拿到API密钥,从而快速上手这项技术。为了让开发者更轻松地从OpenAI平台切换过来,Llama API与OpenAI的SDK保持完全兼容。此外,Meta还与Cerebras和Groq合作,进一步优化了Llama API的表现。Cerebras表示,其Llama 4 Cerebras模型每秒可处理2600个tokens,这一速度比传统NVIDIA GPU方案快了近18倍。

依据Artificial Analysis的测试数据,这样的速度远远超过ChatGPT的130个tokens每秒和DeepSeek的25个tokens每秒。Cerebras的CEO兼联合创始人Andrew Feldman称:“我们很高兴把Llama API打造为全球最快的推理API。对于希望开发实时应用的开发者而言,Cerebras的技术能让AI系统的运行效率远超GPU云。”

另外,Groq提供的Llama 4 Scout模型处理速度为460个tokens每秒,虽然稍低于Cerebras,但仍比其他GPU方案快四倍。在Groq平台上,Llama 4 Scout的价格为每百万输入tokens 0.11美元,每百万输出tokens 0.34美元;Llama 4 Maverick的定价则为每百万输入tokens 0.50美元,每百万输出tokens 0.77美元。

需要注意的是,本文包含一些外部链接,仅供参考,具体结论需自行判断。

本文来源: 图灵汇 文章作者: 陈丽慧