跳到正文
原文
ArtificialAnlys· @ArtificialAnlys · X·· 16 小时前AI 评分62

OpenAI Web Search 登场 Artificial Analysis Search Index 得分 74 排第五

AI 导读

Artificial Analysis 测评显示 OpenAI Web Search 首次登上其 Search Index 得分 74,为第 5 名,落后于 Perplexity、Octen、Parallel 和 Brave;在 26 个产品中并列第 7,较同模型无搜索的 33 分提升 41 分。

正文 · AI 翻译

OpenAI Web Search 在 Artificial Analysis Search Index 上首次亮相即得 74 分,是第 5 佳提供商,排在 Perplexity、Octen、Parallel 和 Brave 之后

@OpenAI Web Search 是我们榜单上首个集成的第一方搜索工具。它不再像以往那样由智能体在我们的 Stirrup 框架中调用 Search API,而是由 GPT-5.6 Luna(中等推理)调用 OpenAI 内置的 web_search 工具,由 OpenAI 在一次 Responses API 调用中完成整个搜索循环。所有配置均使用相同的底层模型 GPT-5.6 Luna(中等推理)。

每个任务成本约 $0.05,OpenAI Web Search 比 Parallel(advanced,$0.06)和 Perplexity(medium,$0.07)更便宜,但大约是 Octen($0.024)的两倍,而 Octen 的得分高出 3 分。

OpenAI Web Search(medium 搜索上下文)的关键基准测试结果:

➤ Artificial Analysis Search Index 上第 5 佳提供商:OpenAI Web Search 得分 74,比同一模型不带搜索时(33 分)高出 41 分。在 26 款产品中排名第 7,与 You.com(highlights)、Nimble(standard)和 Exa(auto)并列 74 分,落后于三款 Perplexity 变体(77 至 80 分)、Octen(77 分)、Parallel(advanced)和 Brave(LLM context)的 75 分

➤ OpenAI Web Search 在 AA-Omniscience(我们的专有事实性问答基准)上表现最佳,准确率达 72%。在 26 款搜索提供商变体中排名第 3,仅落后榜首 Firecrawl(73%)1 分。BrowseComp 需要跨多次搜索进行多跳推理,是其最弱的项目:73.5% 的成绩在 26 款中排第 13,明显落后于 Perplexity 变体和 Octen(85% 至 87%)

➤ OpenAI Web Search 完成相同任务所用 token 更少:OpenAI 每个任务计费约 4 万输入 token(含搜索结果),而榜单上最精简的 Search API Perplexity(low)为 12.5 万。其模型成本在榜单上属于最低之列,每个任务约 $0.009

➤ 内置搜索的单任务成本低于大多数 Search API:每个任务约 $0.05,OpenAI Web Search 比榜单上 25 款 Search API 产品中的 17 款更便宜(中位数 $0.067),包括 Parallel(advanced,$0.06)和 Perplexity(medium,$0.07)。Octen 成本约为其一半($0.024),得分高出 3 分

关键细节:

➤ 配置:GPT-5.6 Luna(中等推理),使用 OpenAI 的 web_search 工具,search_context_size 设为 medium,在一次 Responses API 调用中完成

➤ 定价:每 1000 次 web_search 调用 $10,另加搜索内容,后者由 OpenAI 作为模型输入 token 计费

➤ 污染:我们通过该工具的域名过滤器屏蔽已知的污染来源

来源:ArtificialAnlys · x.com