在 max 模式下结果更令人印象深刻!6.1 sol 的表现超过了 Opus 5.5,同时使用的 token 少了 4 倍。
#模型发布
#模型发布
gen_obligation@gen_obligationAI 评分 X:Peter Steinberger (@steipete)AI 评分 Fermion AI 发布 Phonon-2 语音识别模型,164MB 体积称平均准确率超过 Whisper large
Fermion AI 发布语音识别模型 Phonon-2,下载体积仅 164MB,官方称其平均准确率超过体积约为其 10 倍的 OpenAI Whisper large。该模型可在 MacBook Air 上 20 秒转写 1 小时音频,权重以 CC-BY-4.0 协议开放。
Simon WillisonAI 评分 GPT 6.1 Sol:以五分之一价格实现接近 Astra 的智能
Simon Willison 发布博文《GPT 6.1 Sol: Near-Astra intelligence for a fifth of the price》,讨论 GPT 6.1 Sol 以约五分之一的价格提供接近 Astra 的智能水平。原文未披露参数规模、benchmark 分数或具体定价等细节。
arcprize@arcprizeAI 评分 sama@samaAI 评分 OpenAI@OpenAI精选AI 评分 OpenAI@OpenAIAI 评分 OpenAI 表示 GPT-6.1 Sol 在其对齐评测中相比 GPT-6 Sol 有明显改进,表现更接近 GPT-6 Astra。官方称它对自身局限更透明,在尊重用户意图和安全约束方面也更可靠。
OpenAI@OpenAI精选AI 评分 OpenAI 宣布推出 GPT-6.1 Sol,称其智能水平接近 Astra,价格仅为后者的五分之一,是目前同等性能下最具成本效益的模型。
HuggingPapers@HuggingPapersAI 评分 后训练会在无关决策上留下行为痕迹 仅用 5,664 个单词的教师答案,学生模型在 HumanEval+ 上提升 +5.34pp——却从未见过代码。
Hugging Face Blog精选AI 评分
NVIDIA 发布 Kumo Tabular 表格基础模型,在四个基准排名第一
NVIDIA 发布开源表格基础模型 Kumo Tabular,给定带标签的表格行即可在单次前向传播中预测新行标签,无需训练、调参和特征工程,同时支持分类与回归。
推荐理由:原文给出模型规模、训练数据来源与四个基准排名,可据此判断表格基础模型相对梯度提升树路线的差异。
OpenAI News精选AI 评分 OpenAI 发布 GPT-6.1 Sol,主打编码与电脑操作
OpenAI 发布 GPT-6.1 Sol,官方称其具备接近 Astra 的智能水平,面向编码、电脑操作和专业工作场景。该模型标准 API 输入与输出 token 价格均为 Astra 的五分之一。
推荐理由:OpenAI 公布 GPT-6.1 Sol 的定位与定价,读者可据此比较它与 Astra 在编码和电脑操作上的取舍。
ojiji2025@ojiji2025AI 评分 我试用了 Kling 4.0 flash,没有让我失望! 与 Kling 3.0 相比,快速运动有了巨大提升! 干得漂亮 @Kling_ai
SpaceXAI@SpaceXAIAI 评分 Simon Willison精选AI 评分 Anthropic 发布 Claude Sonnet 5.5,速度提升 30% 以上
Anthropic 发布新 Sonnet 模型 Claude Sonnet 5.5,官方称其运行速度快 30% 以上,多数工作成本最多降低 30%,定价与 Sonnet 5 相同但在各项基准上均优于后者。
推荐理由:作者实测了 Sonnet 5.5 的思考预算与免费层表现,可据此了解它在编码任务上的定位与成本取舍。
ClaudeDevs@ClaudeDevsAI 评分 claudeai@claudeaiAI 评分 claudeai@claudeaiAI 评分 claudeai@claudeaiAI 评分 一系列 Claude Sonnet 5.5 的早期实验推文串。 @_re_pete 制作的秋叶模拟器,用 Sonnet 5 与 Sonnet 5.5 对比。
cursor_ai@cursor_aiAI 评分 Cursor 官方宣布 Sonnet 5.5 现已在 Cursor 中可用,并称它是一个很强的模型,在许多任务上表现与 Opus 相当。
ClaudeDevs@ClaudeDevsAI 评分 ClaudeDevs@ClaudeDevsAI 评分 bcherny@bchernyAI 评分 dongxi_nlp@dongxi_nlpAI 评分 Claude Sonnet 5.5 发布。作者以 OpenAI 支持者口吻感叹 Claude 正夺走自己的偏好,并调侃 OpenAI 阵营家都被偷完了。
AnthropicAI@AnthropicAI精选AI 评分 Anthropic 官方宣布 Claude Sonnet 5.5 现已可用(Claude Sonnet 5.5 is now available)。原文仅提供这一发布信息,未给出更多细节。
NevFlynn@NevFlynnAI 评分 Eleven v4 是我们最具情感表现力的模型。 我们做了一个 demo 来展示它的情感范围,其中 [audio tags] 塑造每个提示词的情感。
AIatMeta@AIatMetaAI 评分 OpenBMB@OpenBMBAI 评分 thexpin@thexpinAI 评分 华为已开源 openPangu 2.0 的预训练、监督微调和强化学习后训练代码。该发布扩展了其开源 AI 模型计划,围绕昇腾硬件上的原生训练与推理构建,相关模型组件正逐步添加到开源平台。
Hugging Face Blog精选AI 评分
H公司发布 Holo4 系列智能体模型,含 27B 与 35B-A3B 两个版本
H公司发布 Holo4 系列智能体模型,包含 27B dense 与 35B-A3B Mixture of Experts 两个版本,均已上线 H Models API,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 形式开源在 Hugging Face,同时发布 Holotron4 Nano。
推荐理由:Holo4 同时覆盖 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,可据此判断通用计算机操作智能体的路线取舍。
MiniMax_AI@MiniMax_AIAI 评分
Ronny_MiniMax@Ronny_MiniMaxAI 评分 MiniMaxAgent@MiniMaxAgentAI 评分 MiniMax 最新文本模型 M3.1-Flash-Preview 今日在 MiniMax Code 首发。 面向日常开发打造,快速、可靠,可投入实际工作,从快速修复 bug 到完整功能开发。
Meituan_LongCat@Meituan_LongCatAI 评分 opencode@opencodeAI 评分 LongCat-2.5-Preview 现已在 OpenCode 上免费开放两周 - 1M Context - 多模态 - 零数据保留
WorkBuddy_AI@WorkBuddy_AIAI 评分 t_mux@t_muxAI 评分 viggle-turbo for Qwen-Image-2.1 不只是更快——对大多数提示词来说,效果与 base 一样好。
opencode@opencodeAI 评分 Operation Cheepseek 第二阶段: DeepSeek v4.1 Flash 的 $60 用量现已永久生效 enjoy :)
Meituan_LongCat@Meituan_LongCatAI 评分
Latent SpaceAI 评分Latent Space 宣布 AINews v3 与 Discord 合并等改版计划
Latent Space 公布未来一周的改版计划:AINews 将升级至 v3,并与 Latent Space Discord 合并,以解决 Discord 垃圾推广信息增多的问题。团队还计划迁移至 Beehiiv 并启用新主页,同时重新开放赞助与 PR 合作,并已新设 Business/Ops Manager 和 Head of Editorial。
Google DeepMind精选AI 评分Google DeepMind 发布 Gemini 3.8 Live with Live Avatar
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,为原生实时对话模型加入动态视觉形象,即日起在 Gemini Enterprise 可用。
推荐理由:官方给出 Live Avatar 的能力边界与开放入口,读者可据此判断实时视频对话在企业场景的可用性。