#多模态
#多模态
romainhuet@romainhuetAI 评分 claudeai@claudeaiAI 评分 higgsfield@higgsfieldAI 评分 AravSrinivas@AravSrinivasAI 评分 Perplexity CEO Aravind Srinivas 列出近期多个开源贡献:pplx-decider-v1-27b 多模态决策模型在 11 个基准平均 85.7%。
The DecoderAI 评分Suno 推出 Speech 功能,可生成带配乐的语音音频
AI 音乐生成器 Suno 新增 Speech 功能,可将口述文本与匹配的背景音乐合成为单条音轨,用户输入想法或文字并描述想要的音色与音乐风格,模型即生成人声与音效。
AIatMeta@AIatMetaAI 评分 milichab@milichabAI 评分 ericzakariasson@ericzakariassonAI 评分 ChatGPT@ChatGPTAI 评分 _akhaliq@_akhaliqAI 评分 自适应奖励路由 通过前向过程 RL 实现联合音视频扩散的动态多奖励优化 论文:huggingface.co/papers/2609.3…
RunwayMLDevs@RunwayMLDevsAI 评分 时尚品牌如何使用 Runway Dev,从第一张草图到最终广告大片。 将草图渲染为真实服装,探索配色和图案,生成电商产品图,并在影棚或外景拍摄模特照片和视频。 观看完整演示。
NewsFromGoogle@NewsFromGoogleAI 评分 Gemini官方回顾9月AI发布,包括前沿模型Gemini 4 Argon,具备高级推理能力与1-million-token输出上限,主打网络安全防御场景。
_akhaliq@_akhaliqAI 评分
Kling_ai@Kling_aiAI 评分 Kling 4.0 现已开启封闭测试,正式发布将于今年 10 月到来。 Kling 4.0 将视频创作提升到新的视觉真实感、创意控制和叙事完整度水平,
MeshyAI@MeshyAIAI 评分 新功能抢先看。👀 你能想象《思想者》穿上雪地靴吗?Meshy 可以做到。 选中特定区域,输入你想要修改的内容。3D 创作即将变得更简单、更有趣。 Meshy Edit。敬请期待。
npaka123@npaka123AI 评分 sundarpichai@sundarpichaiAI 评分 在忙碌的一周里,SynthID Bio——我们为 AI 设计的蛋白质打造的水印技术——是科学诚信和生物安全的一大步!恭喜团队 @GoogleDeepMind
X:Peter Steinberger (@steipete)AI 评分 Griffin 发布:首个通过视频图灵测试的模型
Griffin 发布,被称为首个通过视频图灵测试的模型,48% 与其实时对话的人认为它是真人,此前系统的通过率低于 3%。它还在 NVIDIA 的全双工 AI 视频基准上排名第一,被称为首个 Human Interaction Model(HIM)。
NewsFromGoogle@NewsFromGoogleAI 评分 mattbergland@mattberglandAI 评分 GoogleDeepMind@GoogleDeepMindAI 评分 观看 → goo.gle/4de3fiR Spotify → goo.gle/4dKZwte Apple Podcasts → goo.gle/4dQqKyH 或在你收听播客的任何地方收听!🎧
GoogleDeepMind@GoogleDeepMindAI 评分 perplexity_ai@perplexity_aiAI 评分
X:商汤 SenseTime (@SenseTime_AI)AI 评分 商汤 SenseNova 6.8 Flash Preview 动态设计让静态图像动起来
商汤发布 SenseNova 6.8 Flash Preview 的"动态设计"(Dynamic Design)功能,可将静态图像转化为动态视频。官方演示包括黄果树瀑布、青海门源金色花海等场景,以及熊猫动画片段。
X:商汤 SenseTime (@SenseTime_AI)AI 评分 商汤 SenseNova 6.8 Flash Preview 驱动 Dynamic Design,让静态图像动起来
商汤发布由 SenseNova 6.8 Flash Preview 驱动的 Dynamic Design,可将静态图像转化为动态内容。该功能以预览版形式亮相,官方演示展示了黄果树瀑布、青海门源等静态图片的动态化效果。
GoogleDeepMind@GoogleDeepMindAI 评分 Google DeepMind 发布 SynthID Bio,一套面向 AI 生成生物设计的水印方法家族。官方称这是世界首次能在不影响蛋白质生物功能的前提下,将不可感知的签名直接嵌入蛋白质序列中。
arena@arenaAI 评分 X:Suno (@suno)AI 评分 Suno 上线 banoffeemusic 实验曲目《Make Me Metal》,由 v6 创作并在 Studio 2.0 完成
banoffeemusic 的实验曲目《Make Me Metal》已在 Suno 上线,同步发布由 Nina McNeely 执导并编舞的音乐视频。该曲目使用 v6 创作,并在 Studio 2.0 中完成制作。
thsottiaux@thsottiauxAI 评分 让我的 dot 给我画一幅画。它发给我一张卡通风格的图后,我让它再努力一点,在网上找一张我最近的照片。这次画得好多了。 下面的视频是我在点击操作我的 dot 的电脑。
arena@arenaAI 评分 Gemini 4 Argon (High) 在 Text Arena 以 1525 分排名第一,在 Code Arena: WebDev 以 1679 分排名第八。
aipulseda1ly@aipulseda1lyAI 评分 ArtificialAnlys@ArtificialAnlys精选AI 评分 推荐理由:原文给出智能指数、成本和幻觉率的横向对比,读者可据此判断新模型相对竞品的性价比位置。
andonlabs@andonlabsAI 评分 OfficialLoganK@OfficialLoganKAI 评分 Google 内部众多同事为打造这个模型付出了大量工作,看到这里的进展令人惊叹,而这仅仅是个开始!迫不及待想让更多人用上 Gemini 4 Argon。
Google DeepMind精选AI 评分Google DeepMind 发布 Gemini 4 Argon 前沿模型
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后将逐步面向开发者、企业和消费者推出,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元。
推荐理由:Gemini 4 Argon 的 1M 输出 token 与多项基准成绩,展示了长程复杂任务上的能力边界变化。
runwayml@runwaymlAI 评分 ManusAI@ManusAIAI 评分 看看你在 Manus 中能玩出什么花样,我们与合作伙伴 @tripoai 合作 tripo3d.ai/blog/manus-2-0-me…
ManusAI@ManusAIAI 评分 用 Manus Game Dev 将想法变成有趣的 3D 赛车游戏。🏎️ 车辆?由我们的合作伙伴 @tripoai 生成的 3D 模型。
X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 Vivix A1 Playground 发布:可实时打断、全身动作的 AI 角色
Vivix Labs 推出 Vivix A1 Playground + Agent,可构建能说话、全身动作并与用户实时互动的 AI 角色。角色支持在说话或行走中途被打断,无需重置场景即可改变路线,拿起物体也能保持形状。用户可自定义外观、性格与声音,还能与角色玩网页游戏、互动道具。
X:Suno (@suno)AI 评分 Suno v6 如何帮 banoffeemusic 融合曲风、探索新声音
Suno 发布视频展示音乐人 @banoffeemusic 使用 v6 创作:她从冷门影响中取材、融合多种曲风,把声音带到新方向。她认为一首歌直到让自己感到意外才算完成。