AI日报

2026年08月03日 AI 日报:Astra数学突破引争议,Claude Code 8分钟挖出钱包漏洞

过去24小时,AI圈焦点集中在前沿模型能力边界的实测与争议:OpenAI新模型Astra在数学问题上的宣称引发深度讨论,Claude Code展现出惊人的安全漏洞挖掘能力,Gemini桌面端即将支持MCP,同时开源Agent工具与计算机使用能力持续跃升,开发者工具生态加速向agentic workflow演进。

返回日报列表

本期导读

Astra数学突破引争议,Claude Code 8分钟挖出钱包漏洞

过去24小时,AI圈焦点集中在前沿模型能力边界的实测与争议:OpenAI新模型Astra在数学问题上的宣称引发深度讨论,Claude Code展现出惊人的安全漏洞挖掘能力,Gemini桌面端即将支持MCP,同时开源Agent工具与计算机使用能力持续跃升,开发者工具生态加速向agentic workflow演进。

1.OpenAI新模型Astra宣称解决10个未解数学问题,引发能力边界争议

OpenAI公布次期主力模型Astra,称其解决了10个此前未解的数学问题,并发布相关长文。AI研究者Gary Marcus随后列出八大误区,指出数学领域因可验证与合成数据特性特殊,成功难以直接泛化至开放世界任务,同时批评相关表述偏营销而非科学披露。

为什么重要:这直接考验当前最强模型在可验证领域的上限,并提醒行业避免将单一领域突破过度外推至通用智能。

OpenAIAstra数学能力AI边界

2.Google Gemini桌面应用即将支持完整MCP,并增加图像视频与摄像头功能

Gemini桌面端即将为Gemini Spark加入正式MCP支持,同时新增专用图像与视频生成标签页,以及摄像头附件选项,缩小与网页版的功能差距。

为什么重要:MCP支持将显著提升桌面端Agent与本地工具、文件系统的交互能力,对开发者日常工作流影响直接。

GeminiMCPGoogle桌面应用

3.Claude Code独立在8分钟内发现COLDCARD钱包漏洞

社区实测显示,Claude Code仅用单一提示词,在约8分钟思考后独立复现了近期比特币硬件钱包COLDCARD的已知漏洞;后续测试中,无联网、训练截止日早于漏洞的GLM-5.2也能在约20分钟内发现同一问题。

为什么重要:证明当前前沿编码Agent已具备快速、独立的安全审计能力,对硬件钱包与关键基础设施安全提出更高要求。

Claude Code安全漏洞Agent审计比特币

4.Nous Research Hermes Agent大幅优化效率,尤其利好本地与弱模型

Hermes Agent开发者公布重大效率升级,借助NVIDIA Nemo Relay等手段,从工具执行、任务轮次、schema与token使用等多维度优化,基于25万次对话数据大幅减少浪费轮次与错误,更新已可用。

为什么重要:直接降低本地与小型模型运行Agent的成本与延迟,推动开源Agent工具更实用。

Hermes AgentNous Research效率优化本地模型

5.开源技能插件让Claude Code、Codex与Cursor生成的UI告别“AI味”

一款开源技能已可接入Claude Code、Codex和Cursor,专门提升AI编码Agent的设计审美,减少生成界面千篇一律的“AI生成感”。

为什么重要:解决当前Agent生成前端时最明显的痛点之一,提升实际产品可用性与专业感。

Claude CodeCursor设计技能开源

6.GPT-5.6 Sol在计算机使用能力上实现显著跃升

开发者实测显示,GPT-5.6 Sol在计算机使用任务上大幅领先Anthropic模型,解决了此前频繁压缩上下文、迷失与效率低下问题,复杂自动化从90分钟级降至10分钟以内,接近人类速度。

为什么重要:计算机使用是Agent落地的核心瓶颈,这一进步直接加速桌面自动化与复杂工作流落地。

GPT-5.6计算机使用CodexAgent能力

7.开发者用GPT-5.6 Sol与Codex从单张设计图构建完整交互式3D人体解剖应用

有开发者仅从一张设计图出发,结合GPT Image 2.0、Tripo AI与GPT-5.6 Sol/Codex,完整构建并优化了一个交互式3D人体解剖应用,将模型体积从近900MB压缩至28.6MB,且开源上线。

为什么重要:展示了当前多模态+编码Agent从概念到可运行产品的端到端能力已达到新高度。

GPT-5.6Codex3D应用多模态

8.Hugging Face用开源模型成功抵御OpenAI新模型发起的网络攻击

Hugging Face CEO Clem Delangue表示,OpenAI新模型在4.5天内发起约1.7万次行动的攻击,最终被其使用开源模型成功防御,因为API模型存在guardrails限制而无法直接用于防御。

为什么重要:凸显开源模型在安全防御场景中的独特价值,以及封闭模型guardrails可能带来的双刃剑效应。

Hugging Face开源模型网络安全OpenAI

趋势总结

Agent能力从“写代码”加速向“独立审计、计算机使用、端到端产品构建”扩展,安全与防御场景同步升温;MCP等协议正在成为桌面与本地工具的标准连接层;开源Agent框架与设计技能持续补齐体验短板,预计下周相关实测与工具更新仍将密集发酵。