#DeepSeek
#DeepSeek
omarsar0@omarsar0AI 评分
The DecoderAI 评分Aleph Alpha 研究:Qwen、DeepSeek、Kimi 等中国 AI 模型在敏感话题上回避或复述官方立场
Aleph Alpha 用自建基准测试了阿里 Qwen、DeepSeek 和月之暗面 Kimi 等中国模型,覆盖天安门、台湾、新疆等 967 个敏感话题,其评分系统仅将 17% 至 41% 的回答评为平衡,其余为复述官方立场、回避或拒答。
Hugging Face Blog精选AI 评分
NuminaMath 如何赢得首届 AIMO 进步奖
Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AIMO 进步奖,在私有测试集 50 题中解出 29 题。方案基于 DeepSeekMath-Base 7B 做两阶段微调,先学自然语言链式推理,再用 GPT-4 生成的工具集成推理数据训练模型调用 Python REPL。
推荐理由:NuminaMath 团队复盘了夺冠方案的两阶段微调、SC-TIR 解码与内部验证集设计,可供做数学推理微调的人参考。