Google Books 上的 Magic Pointer 是一个很棒的功能,需要时可以从 Gemini 获得帮助,而当你只想进行点击操作时,它又不会打扰你。
#多模态
#多模态
backlon@backlonAI 评分 joshwoodward@joshwoodwardAI 评分
Kling_ai@Kling_aiAI 评分 可灵 Kling AI 宣布 Kling 4.0 将于 10 月发布,Kling 4.0 Flash 现已面向 Ultra 年度订阅用户开放。
genel_ai@genel_aiAI 评分 AIatMeta@AIatMetaAI 评分 higgsfield@higgsfieldAI 评分 用 Claude Opus 5.5 通过 Higgsfield MCP 在 After Effects 中进行动效设计: higgsfield.ai/mcp?tab=claude
MeshyAI@MeshyAIAI 评分 dongxi_nlp@dongxi_nlpAI 评分
X:Cohere(@cohere)AI 评分 Cohere Parse 5 解析企业文档:表格、图像、边界框、流程图
Cohere 的 Parse 5 面向常见格式的企业文档,宣称提供最优价格,可解析并返回表格、图像、边界框和流程图等内容。该帖未披露具体定价、上下文长度或可用方式,仅引导查看演示。
frxiaobei@frxiaobeiAI 评分
vkuoo@vkuooAI 评分 milos_gis@milos_gisAI 评分 X:马东锡 NLP (@dongxi_nlp)AI 评分 Claude Code + Opus 5.5 制作的《什么是 Transformer》视频效果超过 GPT6 组合
用户用 Claude Code + Opus 5.5 制作了一支讲解 Transformer 的 JS 视频,效果超过其此前用 GPT6 搭配各种 skill、Manim 和 Excalidraw 的成果,并因此重新订阅 Claude。提示词要求深入浅出、面向高中生,讲清注意力机制乃至部分数学概念,允许联网检索和安装工具。
googlechrome@googlechromeAI 评分 GoogleAI@GoogleAIAI 评分 X:Suno (@suno)AI 评分 Suno v6 如何将舞蹈动作变成歌曲:Braylon Browner 首支音乐视频发布
Suno 发布由编舞师 Braylon Browner 使用 v6 将舞蹈动作转化为歌曲的演示,其首支音乐视频由 Nina McNeely 执导。Browner 的创作理念是动作先于音乐,v6 被用于把肢体动作变成歌曲并拓展编舞流程。视频可在 suno.com/braylon 观看。
higgsfield@higgsfieldAI 评分 Meituan_LongCat@Meituan_LongCatAI 评分 LumaLabsAI@LumaLabsAIAI 评分 MeshyAI@MeshyAIAI 评分 joseit@joseitAI 评分
Latent SpaceAI 评分Runway 的 WorldPrompt 与实时世界模型工程
Runway 本月早些时候推出 GWM Worlds 2 研究预览,把高保真视频与音频生成变成实时交互式模拟,并新增 WorldPrompt 输入格式,可固定环境部分要素(含首帧)并生成带时间戳的事件。
Dexerto@DexertoAI 评分 一款AI工具声称可以让你打断Elon Musk在Joe Rogan播客上的发言,向他提问并生成他的“回答”。 一段展示其实际效果的演示视频已走红。
X:Krea AI (@krea_ai)AI 评分 Krea 即将登陆 Muse,首批生成内容由用户决定
Krea 宣布即将接入 Muse 平台,并向用户征集首个生成内容的想法。有用户反馈,在 Krea 上选择 Wan 3 作为模型时,输入视频参考仅支持 10 秒,而 Wan 3 本身可接受 15 秒输入视频。
ViggleAI@ViggleAIAI 评分 ViggleAI@ViggleAIAI 评分 Google 下周要把 TPU 送上轨道,所以我们不得不跟进。 用 Viggle Animate 把任何人换成酒店大堂趋势。
googlechrome@googlechromeAI 评分 从在 Chrome 中使用 Gemini 进行练习测验和媒体问答,到跨设备接续上次进度,Chrome 的新功能为你提供了更多学习方式。📚 了解详情:goo.gle/4dSnCSS
Google Research精选AI 评分Google Research 发布 AI 视频联合导演框架,实现连贯长视频生成
Google Research 发布 AI video co-director 等多智能体框架,用于生成连贯的长篇多镜头视频,相关论文将出现在 COLM 2026 和 EMNLP 2026。
推荐理由:Google 把长视频生成拆成规划、分镜、自回归生成与闭环修正四套框架,并给出多组基准上的连续性提升结果。
Google DeepMind精选AI 评分Google DeepMind 发布 Gemini 3.8 Live with Live Avatar
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,为原生实时对话模型加入动态视觉形象,即日起在 Gemini Enterprise 可用。
推荐理由:官方给出 Live Avatar 的能力边界与开放入口,读者可据此判断实时视频对话在企业场景的可用性。
GoogleCloudTech@GoogleCloudTechAI 评分
minchoi@minchoiAI 评分 这个 AI 太疯狂了。 你现在真的可以和视频对话了。 提问。改变场景。切换语言。进入那个世界。 ACTx486 感觉像是新媒介的一瞥。
LumaLabsAI@LumaLabsAIAI 评分 Hugging Face BlogAI 评分
Liquid AI 发布 LFM2.5-VL-DSpark 草稿模型,加速视觉语言模型推理
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,解码速度在设备端最高提升 3.13x、H100 上最高 2.66x,端到端最高提升 2.62x 和 2.27x。该草稿模型约 280M 参数,仅增加 8.9% 参数量,首日支持 llama.cpp、MLX-VLM 和 SGLang,输出质量不变。
MeshyAI@MeshyAIAI 评分
Latent SpaceAI 评分Meta Connect 2026 发布 Muse 智能体与眼镜硬件,前沿模型仅预告未发布
Meta 在 Connect 2026 上把个人智能体 Muse 作为硬件加智能体战略的核心,发布语音与实时视频能力、Muse Realtime Avatar 研究模型、Ray-Ban Meta Gen 3 与售价 1299 美元的 Meta VR Glasses,以及 12 月发货的钥匙扣设备 Muse Charm,并预告但未发布新前沿模型。
TencentHunyuan@TencentHunyuanAI 评分 AIatMeta@AIatMetaAI 评分 阅读我们的研究博客,了解有关 Muse Realtime Avatar 的更多信息:research.meta.ai/blog/bringi…
AIatMeta@AIatMetaAI 评分 AIatMeta@AIatMetaAI 评分 X:马东锡 NLP (@dongxi_nlp)AI 评分 马东锡:AI 视频生成搞不定"左手六右手七"的脑血栓走路
马东锡 NLP(@dongxi_nlp)发现 AI 视频生成的一个死角:"左手六,右手七,左脚画圆,右脚踢"的脑血栓走路方式,他自己多次尝试均未成功。评论区有人反馈 AI 生成的动作要么手脚对不上、要么不协调,也有人认为跨帧注意力机制会直接崩掉、纯靠 prompt 会被融成麻花。