#多模态
#多模态
ArtificialAnlys@ArtificialAnlysAI 评分
OpenBMB@OpenBMBAI 评分 在 iPhone Air 上跑出 37 tok/s 确实很猛。🚀 这正是小型、能力强的开源模型的闪光点:无需云端 GPU 也能拥有强大的多模态智能。看到 MiniCPM5-2B 在移动端流畅运行真好。
rohanpaul_ai@rohanpaul_aiAI 评分 ArtificialAnlys@ArtificialAnlysAI 评分 testingcatalog@testingcatalogAI 评分 testingcatalog@testingcatalogAI 评分 Google@GoogleAI 评分
HuggingPapers@HuggingPapersAI 评分 NVIDIA 发布 Long-WAM,一个通过扩展视觉上下文实现机器人实时控制的世界动作模型。原文指出,能访问历史不等于会用历史,当视频基础模型采用自回归预训练时,更长的历史带来的收益会大得多。
Hugging Face BlogAI 评分
TII 发布 1.6B 阿拉伯语语音识别模型 Falcon-ASR,主打阿联酋方言
TII 在 Hugging Face 发布 Falcon-ASR,一个 1.6B 参数、面向阿拉伯语尤其是阿联酋方言的语音识别模型,同时支持英语、法语、西班牙语和葡萄牙语,五种语言共用同一权重且无需指定语言标志。
OpenAI News精选AI 评分 GPT-6 在 ChatGPT 全球上线并带来 Intelligent UI
GPT-6 正在 ChatGPT 中全球推出,并带来 Intelligent UI,提供更快的响应以及可直接探索和使用的可视化与交互体验。
Hugging Face Blog精选AI 评分
Liquid AI 开源 d1-3B 与 d1-omni-600M 端侧决策模型
Liquid AI 发布 d1 决策模型家族的两款开放权重模型 d1-3B 和 d1-omni-600M(实验版),在 Decision Index 0.2.1 上 d1-3B 得分 48.57,为 10B 以下最佳,超过 Decider 35B-A3B(47.11)。
推荐理由:原文给出决策指数得分与多设备延迟数据,读者可据此判断它在端侧结构化决策场景的可用性。
AravSrinivas@AravSrinivasAI 评分
arena@arenaAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分 Google 发布 EmbeddingGemma 2,一款采用 Apache 2.0 许可、面向端侧多模态 AI 的嵌入模型,可将文本、代码、图像、音频和视频映射到同一可搜索空间。
Google DeepMind精选AI 评分Google DeepMind 发布 EmbeddingGemma 2 开源多模态嵌入模型
Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、采用 Apache 2.0 许可的 740M 参数多模态嵌入模型,将文本、代码、图像、视频和音频统一映射到共享嵌入空间。
推荐理由:原文给出了参数规模、内存占用和上下文长度等具体指标,读者可据此评估它是否适合自己的端侧检索场景。
Simon WillisonAI 评分 Mistral Large 4
Mistral Large 4 作为新模型出现在 Simon Willison 的测试中,被用 `llm -m mistral/mistral-large-4` 与 claude-opus-5.5。
osanseviero@osansevieroAI 评分 testingcatalog@testingcatalogAI 评分 perplexitydevs@perplexitydevsAI 评分 GoogleDeepMind@GoogleDeepMindAI 评分 GoogleDeepMind@GoogleDeepMindAI 评分 Google DeepMind 发布 EmbeddingGemma 2,称这是其首个面向端侧嵌入的原生多模态开放模型。该模型从文本扩展到代码、图像、音频和视频,将这些内容统一到共享空间中。
Google@GoogleAI 评分 Google@GoogleAI 评分 UnslothAI@UnslothAIAI 评分
OpenRouter@OpenRouterAI 评分
TechCrunch · AIAI 评分Mistral AI 发布 1 万亿参数多模态模型 Mistral Large 4
Mistral AI 发布 1 万亿参数多模态模型 Mistral Large 4(ML4),代号 Le Chonk,目前仅通过公开 guardrail endpoint 访问,计划在安全测试完成后于三周内开放权重。
OpenRouter@OpenRouter精选AI 评分 Mistral AI精选AI 评分
Mistral AI 公开预览 Mistral Large 4,月底开放权重
Mistral AI 宣布 Mistral Large 4(非正式代号 le Chonk)进入公开预览,可在 Mistral Studio 使用预览 API,权重将于本月底发布。
推荐理由:原文给出参数规模、开放权重时间表和多组基准成绩,读者可据此评估其与现有开源模型的差距。
testingcatalog@testingcatalogAI 评分 MistralAI@MistralAIAI 评分 GuillaumeLample@GuillaumeLampleAI 评分 Hugging Face BlogAI 评分
Falcon-Emirati-7B 发布:面向阿联酋方言的阿拉伯语模型
Hugging Face 与 Technology Innovation Institute 发布 Falcon-Emirati-7B,基于 Falcon-H1-Arabic 7B 变体微调,专注阿联酋方言的理解与生成。
The DecoderAI 评分Reka AI 发布全模态模型 Rho-1,单模型统一处理文本图像视频与机器人控制
Reka AI 发布了 Rho-1 的研究预览,这是一个 190 亿参数的全模态模型,在单一神经网络中处理并生成文本、图像、视频和机器人控制动作,所有模态以 token 形式运行在同一共享上下文窗口中,无需工具调用或外部模型。
X:可灵 Kling AI (@Kling_ai)AI 评分 可灵 Kling 4.0 与 Kling 4.0 Flash 创作展示
可灵发布 Kling 4.0 和 Kling 4.0 Flash,并展示创作者用其生成的作品。官方称 Kling 4.0 正在推动 AI 创意前进,评论区有用户询问具体发布时间。
AravSrinivas@AravSrinivasAI 评分 ArtificialAnlys@ArtificialAnlysAI 评分 Artificial Analysis 评测显示,Qwen-Image-2.1 最强的图像编辑用例为生产力与知识工作、零售与电商、动画与游戏,其中生产力与知识工作最接近领先者。
ArtificialAnlys@ArtificialAnlysAI 评分 X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 Tavus 发布视频对话模型 Griffin,称首个通过视频图灵测试
Tavus 发布视频到视频模型 Griffin,作者获得早期体验权限,称其能边看边听用户说话,可打断用户、接受被打断,并对房间内发生的事作出反应。
tavus@tavusAI 评分