#多模态
#多模态
AravSrinivas@AravSrinivasAI 评分 AravSrinivas@AravSrinivasAI 评分 ArtificialAnlys@ArtificialAnlysAI 评分 Artificial Analysis 评测显示,Qwen-Image-2.1 最强的图像编辑用例为生产力与知识工作、零售与电商、动画与游戏,其中生产力与知识工作最接近领先者。
ArtificialAnlys@ArtificialAnlysAI 评分 X:Suno (@suno)AI 评分 Suno Studio 2.0:从聊天栏完成分轨、加乐器与自动化
Suno Studio 2.0 支持在聊天栏中完成从一首歌开始、分离音轨、添加新乐器、效果与自动化的全流程操作。该功能将分轨与编曲编辑整合进对话式输入,用户无需离开聊天栏即可完成多步音乐制作。
X:Suno (@suno)AI 评分 Suno 展示语音与背景音乐单次生成:实时音频的新进展
Suno 分享了一段演示,展示语音与背景音乐在一次生成中同步产出。评论者 Gavin Guo 指出,两个生成器争夺同一时间线通常会互相干扰,而这段音乐能随人声自动避让、起伏和强调,而非事后贴附,对实时音频而言是实质性进展。
The DecoderAI 评分AI 智能体从单张照片生成 Blender 3D 场景,但无法判断自己是否做对
研究提出 Image-to-Code 方法,让编码智能体接收单张图片后编写可执行的 Blender 程序,通过写代码、运行、查看结果并迭代修改来还原场景。团队同时发布 LEGO-Bench 基准,包含 104 个室内外场景的 208 张图像和 443 个注册资产,从有效性、几何精度和外观相似度三个维度评分。
X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 Tavus 发布视频对话模型 Griffin,称首个通过视频图灵测试
Tavus 发布视频到视频模型 Griffin,作者获得早期体验权限,称其能边看边听用户说话,可打断用户、接受被打断,并对房间内发生的事作出反应。
testingcatalog@testingcatalogAI 评分 claudeai@claudeaiAI 评分 claudeai@claudeaiAI 评分 claudeai@claudeaiAI 评分 claudeai@claudeaiAI 评分 PixVerse@PixVerseAI 评分 添加 PixVerse 插件,输入 `pixverse cinematic story`,然后描述你想象的故事、氛围或风格。 PixVerse 会为你处理镜头、视觉和节奏。
PixVerse@PixVerseAI 评分 用 PixVerse 将任意角色变成会说话的演讲者 添加新的 PixVerse 插件,选择你的角色。 他们会在镜头前自然地说话、反应和做手势,同时 PixVerse 为你生成视频片段。
HuggingPapers@HuggingPapersAI 评分 UniEvo-VL 一个自进化框架,单个多模态模型同时充当教师和学生,从自身的建设性反馈中学习,在无外部监督的情况下提升图像生成能力。
tavus@tavusAI 评分 karpathy@karpathyAI 评分 thsottiaux@thsottiauxAI 评分 X:Testing Catalog (@testingcatalog)AI 评分 Tavus 发布视频对话模型 Griffin 研究预览
Tavus 推出视频到视频模型 Griffin 的研究预览版,面向实时面对面对话,可从对话中学习交流行为,在对话中边看边听,能中途插话或在有人进入画面时作出回应。
X:Testing Catalog (@testingcatalog)AI 评分 Tavus 发布实时视频对话模型 Griffin 研究预览
Tavus 推出视频到视频模型 Griffin 的研究预览,面向实时面对面对话,可在对话中观看和聆听,并能在对方说到一半时打断或对进入画面的人作出回应。
testingcatalog@testingcatalogAI 评分 testingcatalog@testingcatalogAI 评分
The DecoderAI 评分Tavus 发布 Griffin 人机交互模型,48% 测试者一分钟通话后误认为真人
Tavus 推出 Griffin,公司称其为首个 Human Interaction Model(HIM),可在接收和生成视频的同时处理语音、面部表情、语调、手势和停顿。
TechCrunch · AIAI 评分ChatGPT 上线虚拟试穿与商品收藏功能
OpenAI 宣布在全球范围上线两项 ChatGPT 购物功能,包括虚拟试穿服装与配饰,以及把商品保存到应用内 Library 的 Favorites 收藏功能。
The Verge · AIAI 评分Google 在 Gemini Live 推出 Guided Vision 实时视觉描述功能
Google 在 Gemini Live 中上线 Guided Vision,可在兼容 Android 设备上通过共享摄像头,对镜头所指向的内容提供实时语音描述,帮助读取小字、描述周围环境、寻找或识别物体。
ViggleAI@ViggleAIAI 评分 GoogleDeepMind@GoogleDeepMindAI 评分 水印就像一张数字身份证,可帮助 DNA 实验室验证合成蛋白并保持序列数据库的准确性。 随着这些请求规模不断扩大,验证设计是否来自带有内置安全防护的 AI,将帮助实验室实现自动化并加强生物安全。🛡️
runwayml@runwaymlAI 评分 runwayml@runwaymlAI 评分 runwayml@runwaymlAI 评分 runwayml_labs@runwayml_labsAI 评分 Runway Labs 推出 Project Continuum,一个围绕实时视频界面构建的全新操作系统研究应用。 以下是一个简短的演示走查:
arena@arenaAI 评分 fal@falAI 评分 今天就来试试吧! 文生图 fal.ai/models/blackforestlab… 图像编辑 fal.ai/models/blackforestlab…
fal@falAI 评分 fal@falAI 评分 abstrakt314@abstrakt314AI 评分 OpenRouter@OpenRouterAI 评分 OpenRouter 介绍 FLUX 3 的参考图生图能力:最多可提供 10 张参考图,并用一句提示词描述场景,FLUX 3 会决定每张参考图在画面中的位置并整体渲染整帧。
OpenRouter@OpenRouterAI 评分 X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 Tavus 预览 Human Interaction Model Griffin:能看、能听、能发声、能像人一样呈现
Tavus 预览了其最新模型 Griffin,一款能看、能听、能发声并像人一样呈现的 Human Interaction Model,目前尚未公开可用,此次仅为有限的研究预览。