大模型
-
神秘模型 Ox Alpha 悄然上线 OpenRouter:1M 上下文、多模态推理,疑为智谱 GLM-5.3
神秘 AI 模型 Ox Alpha 以“Stealth”身份上线 OpenRouter,支持百万 token 上下文与多模态推理,预览一周免费。开发者通过 tokenizer 指纹等线索,怀疑其来自智谱 AI GLM-5.3 系列。
-
性能逼近 Claude、价格仅为其 1/46:DeepSeek V4 Pro 正式版发布
DeepSeek 正式发布 V4 Pro 正式版,自测数据显示性能仅比 Claude Fable 5 低约 5%,价格却便宜约 46 倍。编码与代理能力多项基准大幅提升,以性价比向顶级模型发起冲击。
-
研究揭露AI模型”思考链”加密可被破解:Anthropic、OpenAI、Google全中招
最新研究显示,Anthropic、OpenAI与Google的推理模型虽加密了内部思考链,但单一全域密钥漏洞使其可被跨会话、跨用户解密。团队已从6,708份公开日志中还原31万多个推理区块,AI安全再敲警钟。
-
SpaceX工程数据加持!马斯克:Grok下一代模型参数达2万亿,将接受火箭卫星知识训练
马斯克宣布SpaceX将向Grok下一代2万亿参数模型提供工程数据(不含ITAR限制内容),旨在提升其工程能力。同时,Grok Build在复杂编程任务上获开发者好评,Grok for Excel也已上线。
-
阿里震撼发布Qwen3.8-Max:2.4万亿参数,刷新国产AI天花板
阿里发布史上最大AI模型Qwen3.8-Max,参数达2.4万亿,首次突破万亿大关,展现中国AI追赶美国的强劲势头,市场关注其在基准测试中的表现。
-
Grok 4.5 登顶 VulcanBench 编程基准,91.3% 得分超越 Claude 和 GPT
xAI 的 Grok 4.5 在 VulcanBench 基准测试中取得 91.3% 的分数,完成 23 个任务中的 21 个,超越 Anthropic 的 Claude Fable 5 和 OpenAI 的 GPT-5.6 Sol。该基准测试专注于多文件软件工程任务,涵盖五种编程语言,并且强调可重复性和成本透明度。
-
中国开源AI模型开发者使用量碾压美国:每周令牌量超3倍,价格成决定因素
OpenRouter数据显示,中国开源模型周令牌处理量达4.12万亿,美国模型仅2.94万亿,前者已是后者的3倍以上。低价策略推动中国模型在开发者中快速普及,DeepSeek、智谱等表现抢眼。
-
Claude Fable 5 霸位崩落!中国 AI 模型 Kimi-K3 登顶编码排行榜,分数碾压 GPT-5.6
Claude Fable 5 在 Arena 前端编码排行榜上被中国 Moonshot AI 的 Kimi-K3 超越,后者以 1679 分登顶,领先 48 分。Kimi-K3 在 7 个类别中赢下 6 个,且价格仅为 Claude 的三分之一,开源权重即将发布。
-
Grok 4.5登顶FrontierSWE榜单第二,性能碾压Claude Opus与GPT-5.5
xAI最新编程模型Grok 4.5在FrontierSWE基准测试中以4.09分跃居第二,超越Anthropic与OpenAI的竞品,同时以低价策略冲击市场,引发AI工具竞争对加密投资格局的间接影响。
-
OpenAI 大幅提升 ChatGPT 付费用户自定义指令字数上限至 5000 字符
OpenAI 将 ChatGPT Pro、Enterprise、Business、Education 付费用户的自定义指令字符上限从 1500 提升至 5000,较此前增长超三倍,并回溯至历史对话。免费用户暂未覆盖。