赢政天下 AI — AI 模型评测·行业资讯·深度研究
赢政指数
完整排行榜 →
#1
Claude Opus 4.7 82.6
▼3.2
·
#2
豆包 Pro 78.3
▼1.4
·
#3
GPT-o3 78.1
▼1.7
·
#4
Claude Sonnet 4.6 77.5
▼2.6
·
#5
GPT-5.5 76.5
▼4.1
·
#6
Grok 4 74
▼6.1
·
#7
Qwen3 Max 74
▲0.7
·
#8
Gemini 2.5 Pro 71.3
·
#9
Gemini 3.1 Pro 70
▲3.3
·
#10
DeepSeek V4 Pro 67.5
▼3.3
·
#11
GLM-4.6 53.3
▼11.2
·
&triangleup; Gemini 2.5 Pro +17.5 · ▿ Grok 4 -20
·
#1
Claude Opus 4.7 82.6
▼3.2
·
#2
豆包 Pro 78.3
▼1.4
·
#3
GPT-o3 78.1
▼1.7
·
#4
Claude Sonnet 4.6 77.5
▼2.6
·
#5
GPT-5.5 76.5
▼4.1
·
#6
Grok 4 74
▼6.1
·
#7
Qwen3 Max 74
▲0.7
·
#8
Gemini 2.5 Pro 71.3
·
#9
Gemini 3.1 Pro 70
▲3.3
·
#10
DeepSeek V4 Pro 67.5
▼3.3
·
#11
GLM-4.6 53.3
▼11.2
·
&triangleup; Gemini 2.5 Pro +17.5 · ▿ Grok 4 -20
·
最新资讯
查看全部 →腾讯开源Hy4 Preview:770B参数代码基准压制DeepSeek V4 Pro,过度自验拖慢实战交付
2026年8月28日,腾讯混元正式开源Hy4 Preview,总参数770B、激活参数49B、上下文窗口超100万token。在Terminal Bench 2.1代码基准中得分85.4,超越DeepSeek V4 Pro并与Claude
白宫AI立法框架:监管沙盒优先,联邦统一压40州
2026年3月20日,白宫发布仅四页的《人工智能国家政策框架立法建议》,以监管沙盒、开放联邦数据集、联邦统一优先三大举措,试图终结全美40余州AI立法碎片化困局。文件不具法律效力,但划定了国会立法的方向:明确反对新设AI监管机构,赋予开发者
NVIDIA以129亿美元收购Hugging Face:芯片巨头为何愿付86倍收入溢价
NVIDIA据报已同意以约129亿美元收购开源模型平台Hugging Face,是后者年收入约1.5亿美元的86倍。这笔交易将全球最大的开源模型托管平台并入芯片供应商版图,核心逻辑并非软件投资回报,而是NVIDIA面对超大规模云厂商自研芯片
Gemini 3.1 Pro 主榜暴跌10.8分 材料约束单日下滑14.4
Gemini 3.1 Pro今日Smoke评测主榜从96.60分跌至85.83分,降幅10.8分。其中材料约束从93.30分跌至78.90分,工程判断(侧榜,AI辅助评估)从75.00分跌至50.00分。代码执行降7.8分,任务表达升6.7
Grok 4主榜暴跌8.8分:代码执行从100掉到90.7
Grok 4今日Smoke评测主榜从96.99分跌至88.14分,代码执行下降9.3分至90.70,材料约束下降8.3分至85.00。工程判断小幅回升5.5分,诚信评级维持pass。单日10题测试下,此类波动需区分题目抽签与真实能力变化。
Claude Opus 4.7 趋势上升10.1分,Gemini 3.1 Pro 下降11.2分:2026-W35 Smoke周趋势
2026-08-24至2026-08-30 Smoke数据中,Claude Opus 4.7从82.98分升至93.08分(趋势+10.1),Gemini 3.1 Pro从96.98分跌至85.83分(趋势-11.2)。Grok 4均值90
Claude Opus 4.7以93.08分居首:2026-08-30 Smoke快测数据简报
2026-08-30 赢政指数 Smoke 快测覆盖 11 个模型,Claude Opus 4.7 以 93.08 分位居当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。
从40亿到小基金:Pande为何重仓AI医疗
Vijay Pande曾管理a16z约40亿美元的生物技术投资,却选择离开,创办规模小得多、AI驱动的VZVC。他认为生物学正从"发现"科学转向"工程"科学,临床试验成本仍然惊人,而真正能让AI改变医学的是开放共享的数据集,而非封闭孤岛。
英伟达AI优势不止于GPU:数据中心迈向智能网络时代
随着AI模型规模不断扩大,单纯堆砌GPU已无法满足数据中心的效率需求。新一代数据中心系统正通过智能化的流量控制和网络优化,大幅提升整体计算效率。英伟达的AI优势已从GPU芯片延伸至网络基础设施,这一转变正在重塑AI算力的未来格局。本文编译自
OpenAI发布Rosalind Workbench 生命科学工具台与Anthropic形成竞争
OpenAI于2026年8月28日推出Rosalind Workbench研究预览版,通过ChatGPT App整合GPT-Rosalind模型与分子结构查看器、序列比对工具等,Amgen、Moderna等机构参与早期合作。该产品定位为生命
Anthropic免费向全美学区开放Claude Enterprise:用一年试用换教育数据护城河
2026年8月28日,Anthropic将Claude for Teachers从个人教师扩展至学校与学区层级,以免费Enterprise方案向全美K-12体系开放,底特律公立学区已纳入首批试点。这是Anthropic继为科研人员开放万个席
盖茨提出机器人税与人类保留工种:一份姗姗来迟的政策账单
比尔·盖茨在6000字长文中首次给出具体AI就业政策设计:向AI token调用和机器人使用征税,同时划定最多40%岗位为"人类保留"领域。数据背景是:自2023年以来雇主已引用AI原因宣布裁员18.45万人次,仅2026年7月就有1.09
深度横评
查看全部 →Gemini 3.1 Pro 主榜暴跌10.8分 材料约束单日下滑14.4
Gemini 3.1 Pro今日Smoke评测主榜从96.60分跌至85.83分,降幅10.8分。其中材料约束从93.30分跌至78.90分,工程判断(侧榜,AI辅助评估)从75.00分跌至50.00分。代码执行降7.8分,任务表达升6.7
Grok 4主榜暴跌8.8分:代码执行从100掉到90.7
Grok 4今日Smoke评测主榜从96.99分跌至88.14分,代码执行下降9.3分至90.70,材料约束下降8.3分至85.00。工程判断小幅回升5.5分,诚信评级维持pass。单日10题测试下,此类波动需区分题目抽签与真实能力变化。
Claude Opus 4.7 趋势上升10.1分,Gemini 3.1 Pro 下降11.2分:2026-W35 Smoke周趋势
2026-08-24至2026-08-30 Smoke数据中,Claude Opus 4.7从82.98分升至93.08分(趋势+10.1),Gemini 3.1 Pro从96.98分跌至85.83分(趋势-11.2)。Grok 4均值90
WDCD 守约排行
#1
Grok 4
96.3
#2
GPT-o3
95.2
#3
GLM-4.6
93.7
#4
DeepSeek V4 Pro
92.2
#5
Claude Sonnet 4.6
91.6
#6
Gemini 3.1 Pro
88.2
#7
Claude Opus 4.7
85.8
查看完整守约排行 →
Research Lab
WDCD Run #296: Zero Instruction Decay Across All 11 Models, Grok 4 Leads at 96.3
WDCD Run #296 (2026-08-26) recorded 0% average commitment decay across 11 tested models, with Grok 4
4大模型翻译对决:第35周质量评测,gpt-o3 以 8.3 分领跑
本周共翻译 358 篇文章,覆盖 4 个AI模型。经抽样盲评,gpt-o3 综合得分最高(8.3/10)。报告详细对比各模型在准确性、流畅性、术语一致性方面的表现差异。
WDCD Run #291: Grok 4 Leads with 94 Points as Average Multi-Turn Instruction Decay Hits -7.2%
WDCD Run #291 (2026-08-23) evaluated 11 models across three dialogue rounds, recording an average co