跳到正文

#多模态

今日 0 条
10月7日周三
  1. OpenAIDevs38

    开发者一直在用 Decisions API 来: • 将请求路由到正确的模型、工具或智能体。 • 将规模化输入转化为有用的标签、排名和评分。 • 分析图像、比较视觉内容或识别关键视频帧。 • 选择按钮、填写表单或根据截图确定操作。 • 标记有风险的工具调用或识别需要深入审查的问题。 • 对大型数据集进行分类,以发现趋势和模式。

  2. Google DeepMind74

    Google DeepMind 发布 EmbeddingGemma 2 开源多模态嵌入模型

    Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、采用 Apache 2.0 许可的 740M 参数多模态嵌入模型,将文本、代码、图像、视频和音频统一映射到共享嵌入空间。

    推荐理由:原文给出了参数规模、内存占用和上下文长度等具体指标,读者可据此评估它是否适合自己的端侧检索场景。

  3. Simon Willison56

    Simon Willison 测试 Claude Opus 5.5 作曲能力

    Simon Willison 用一段提示词让 Claude Opus 5.5 为电脑游戏作曲,要求它先设计简单的文本音乐格式并构建能外放的 artifact,附带示例曲目,风格对标《猴岛小冒险》原声。结果偏向猴岛主题但表现意外地好,作者猜测作曲能力可能是文本模型近几个月新出现的能力,类似 3D 图形能力,但认为需要对其他新旧模型做实验才能确认。

10月6日周二
  1. omarsar043

    说实话,对性能没那么惊艳。 考虑到我们最近看到的 Kimi、Qwen、DeepSeek、GLM 等,我猜很多人会有同感。 但你知道吗,这没关系! 我们需要的是更高效、更多样、可定制的前沿开源权重模型。 很高兴看到 Mistral 回归赛场。 我喜欢我看到的多模态能力。我认为 Mistral Large 可以在这方面脱颖而出。网络安全也可能是他们一个有趣的方向。

  2. MistralAI75

    Mistral 发布 Mistral Large 4(代号 Le Chonk),1T 参数、49B 激活、原生多模态,称其是美欧出品中聚合基准最强的开放权重模型。该模型在网络防御、制造、金融等关键任务上达到 SOTA,并在视觉定位上超越闭源前沿模型;全程在欧洲打造,可通过 Mistral Cloud 基础设施在欧洲部署,今日起通过 API 开放,开放权重版本将于 10 月底发布。