量子位

量子位

关注
17.7万粉丝
0关注
9.8万被推荐

《量子位》官方网易号

5枚勋章

2次获得编辑精选

追踪人工智能动态
IP属地:北京
更多信息

  • 谁再说科研已经没有新问题了?好方向全被前人占满了??
    如果我说—— 那些已经发表的顶刊论文里,大多都有问题呢? 最近,有研究者用AI Agent「学术打假」后发现: 2026年国际机器学习大会(ICML)上报告的92篇论文中,有58篇已经无法复现。 真假??莫非,猛发顶刊的机会真的来了?
    行业密探
  • 啥情况?统治科研圈几十年的PDF格式,都需要因AI而“退休”…
    因为以后论文的第一读者不是人,而是AI?? 近日,IEEE Spectrum重点关注了一项新研究——ARA(Agent-Native Research Artifact)。它不仅能让AI理解研究结论,还能复现实验、灵活规避失败路线并继续推进研究,让AI从辅助工具升级为科研协作者 据IEEE报道,ARA团队在一篇名为The Last Human-Written Paper: Agent-Native Research Artifacts的论文中,呼吁科学家们停止继续使用PDF撰写传统论文,并表示: AI需要一种不同的内容格式,而AI的需求,理应被置于首位。 论文的第一作者刘嘉晨核心论点是: 一旦AI“榨干”了人类专家所有的数据,它就不再需要人类的任何输入。到那时,AI将开始自主进化。 现在这些只提升AI科学家的能力,却不改造科研知识的共享方式,就像在泥泞路上开F1赛车,难以复现并接续前人的工作。 而PDF就是过去科研知识共享的最核心代表。 是时候了,ARA当立。
    行业密探
  • AI倒查论文100年!99.2%的顶刊都有问题...
    2小时前
  • PDF当死,ARA该立!论文是时候Agent原生了

    2小时前
    图片
  • 宇树会破发吗?王兴兴回应了

    5小时前
    21跟贴
    图片

  • 过去一年,VLA、世界模型、基座模型、强化学习、数据闭环等概念,几乎成为Physical AI公司的共同语言。 但当技术路线逐渐收敛,一个更深层的问题开始暴露:AI如何从真实世界获取数据,形成对环境的理解,再将理解转化为行动,并根据行动结果持续学习。 这背后存在三道“断裂”: - 模型与数据之间,数据规模扩大并不会自动产生对世界的理解,模型暴露的问题需要能够反向推动数据采集和训练优化; - 视觉与行动之间,看见和理解并不等于能够稳定行动,认知还需要经过预测、决策和控制转化为真实动作; - 模拟与真实之间,仿真环境中的能力提升,也需要经过真实世界验证才能成立。 因此,Physical AI下一阶段的竞争,可能不只是模型能力竞争,而是能否建立一套让数据、模型、仿真和真实反馈持续循环的研发体系。 在这一背景下,元戎启行成立Superfluid Lab。该实验室以基座模型为核心,探索VLA、世界模型和多模态能力,并通过大模型算法、仿真算法和AI Infra等方向建设完整技术链路。 它试图解决的问题,也对应Physical AI当前的核心挑战:让模型、数据和现实世界之间减少摩擦,让研究从单点优化转向持续进化。 回看AI发展历史,OpenAI成立时探索的是数字世界智能的基础能力;如今Physical AI正在寻找面向物理世界智能的底层能力体系。 未来竞争的关键,或许不只是拥有一个更大的模型,而是谁能够建立一套持续让模型进化的基础设施。
    行业密探
  • 模型路线趋同之后,Physical AI的胜负手变了

    7小时前
    图片
  • 郎咸朋创业之后,第一次开口了。
    理想汽车前智驾一号位,8年把辅助驾驶从0做到150万辆量产,交付端到端和VLA; 今年3月创立了具身智能公司昆仑行——90天内连融三轮,规模达数十亿元,跑成一家独角兽。 这是他出来创业后的首次公开露面。 对话郎咸朋:具身也会有“蔚小理”,靠融资实现不了物理AGI
    行业密探
  • 对话郎咸朋:具身也会有“蔚小理”,靠融资实现不了物理AGI
    9小时前
  • Claude Code倒计时5天默认自动模式,多花的钱A社自己掏

    11小时前
    图片

  • 连微软都开始心疼Token了?一封内部邮件显示,从7月开始,微软给各业务部门划了AI Token预算红线。更扎心的是,这在硅谷并不是个例。
    行业密探
  • AI带火挖掘机?机械巨头闷声发大财

    20小时前
    图片
    01:05
  • Jeff Dean创立新公司Discovery Loop,透露六页商业计划书

    20小时前
    图片
    01:03
  • 斯坦福公开25年秋季AI自进化课,从Scaling law到推理时缩放

    20小时前
    图片
    01:01
  • 180万刀,连亚马逊都烧不起Claude了
    1天前
    55跟贴
  • GPT-5.6和Fable联手,解决了一道悬了25年的数学难题
    1天前
    6跟贴

  • 斯坦福公开25年秋季AI自进化课,从Scaling law到推理时缩放,拆解工具调用、验证器、评审器和编排器构成的Agent工作流,教模型通过自我反馈实现闭环迭代。
    行业密探

  • 硅谷今年最贵的词,叫Recursive Self-Improving。 它就是指让AI参与迭代自身的模型、算法、数据和研发流程。 这个概念有多火呢? Jeff Dean离职创办的Discovery Loop,方向就是探索AI自动化科学研究。 不只姐夫,AlphaGo缔造者David Silver等一众大牛也在同一条赛道上。 看得出来,这些顶级AI研究者正在形成一个共识: 让AI参与创造下一代AI,让AI持续自我改进并构建更强的AI。 在这个共识之下,一个更棘手的问题出现了。 模型越强,能给AI出题、解题、验证的人越少,高质量训练数据该从哪来? 一支中国团队给出了他们的答案。 由上海交大人工智能学院、深势科技、上海算法创新研究院组成的无尽前沿团队发布BigBang-V1—— 这是首个基于recursive self-improving原生方式训练出的基座模型。 在训练过程中,出题、解题、验证都交给AI把控,通过可验证前沿任务持续生成高质量自演进合成数据,全程无需人类逐题参与。 35B跑赢1T大模型 模型已开源,技术报告也同步公开。 BigBang-V1参数规模35B,推理时激活约3B参数,支持262K长上下文。 它的后训练数据100%由AI自主合成,以科学前沿任务为核心。 在这样的条件下,模型在长程搜索、代码、科学研究、AI研究等评测中,拿下全部35B模型里的10项第一。 不仅如此,在FrontierScience Research、PaperBench等多项高难度科研任务上,成绩甚至超过了1T级的DeepSeek V4 Pro Preview。 基准分数之外,具体任务里的表现更能说明BigBang-V1解决复杂问题的水平。 先看一个高难度生物信息学任务。 转座子定位要求在全基因组测序数据里定位一个47bp的转座子插入位点,模型不仅要识别相关序列,还得遵守RefSeq染色体命名和1-based坐标约定。 BigBang没有去猜坐标,而是利用转座子与染色体之间的连接证据做约束映射: 一个junction对应一个坐标,最终把断点锁定在4144431,每一步证据都可追溯。 在论文复现任务里,BigBang的表现又像一个会自我纠错的工程师。 任务要求把LBCS论文复现为可运行的代码仓库,它在通读完论文之后没有急着交卷,而是在冒烟测试里发现自己写出的实现违反了论文的核心主张: 样本量被固定死了,核心集根本没法收缩。 它推算了扰动规模,发现无法越过触发阈值,于是连续否决了三个候选修复方案,最终把连续扰动改成二进制掩码翻转,问题才真正解决。 第二轮它又发现一个梯度项从计算图中脱离,主动恢复了梯度流,最终复现评分0.7657,全部485个评分点通过331个。 这些案例体现的并不只是分数。 BigBang真正展现出的是把多步证据组织成可验证结论的能力,以及在失败中发现问题、修正方案的本事。 对科研AI来说,这两种能力恰恰最要紧。 毕竟,科研不是背答案,而是从噪声里找证据,在出错时改方案。 不过,以科研任务为核心构建的数据,并没有把BigBang-V1训练成只会答科学题的垂直模型。 BrowseComp基准达到76.5,SWE-Bench Pro拿到54.2,能力增益同时迁移到了长程搜索、软件工程、代码等场景。 我们也拿它实测了一把长程搜索。 让它盘点8月第一周AI圈的大事。它一天一天连着检索了二十多轮、翻了十几个来源。 先用定位候选事件,再逐条打开信源交叉验证,最后还专门找到一手页面核对细节,连发布日期都逐个确认才给出结论。 而且它现搜列出的来源全部真实可访问。 然后我们又让它写了一个太空射击小游戏。 代码写得非常丝滑,打中后爆炸产生粒子特效,左上角还展示了分数、生命、等级游戏UI。 100%纯AI合成的训练数据,为什么能有这样的表现? 要解开这个疑问,得先从训练数据本身说起。 训练数据生产,也可以成为AI优化对象 Recursive Self-Improving火热,业界也都在谈论,但大多数探索还仅仅徘徊在概念层,真正跑通完整闭环的落地案例并不多。 落到实际工作里,现在常见的有两类尝试。 一部分方案只是给模型套上一层工具外壳,比如harness,让模型自己调调工具、改改提示词。 但这样相当于只是把模型的调用方式做了增强,底层的训练管线几乎原封不动,并没有触动模型自我迭代的根源。 还有一类做法则是用大模型对生成的数据做打分筛选。 但这套评判标准是人类预先写死的规则,筛选逻辑本身不会跟着模型能力成长而自我演化。 模型变强之后,旧的评判标尺很快就会失效,依然源源不断产出低价值样本。 单纯靠扩大数据集规模、对已有数据反复清洗过滤,已经很难再撬动能力的进一步跃升。 训练数据仍由人类逐题生产,模型的进化速度被人类出题的速度卡住,这是Recursive Self-Improving落地的核心问题之一。 BigBang团队换了一个角度思考这个问题。 如果模型可以自我改进,那么能不能让训练数据的生产系统本身,也成为被优化的对象? 于是,问题从「如何收集更多科学数据」,变成了「如何让数据生产系统,随着模型能力一起持续进化」。 要解决它,就要回到数据质量这一源头,数据质量不是清洗洗出来的,是任务本身的属性决定的。 如果想要搭建一套能持续自我进化的数据系统,任务必须同时满足两个条件。 首先是前沿性。 任务要位于当前知识或模型能力的边界,甚至没有已知最优答案。 新理论、新数据、新工具不断出现,科学前沿就会持续产生新问题,不会像静态题库一样被模型迅速耗尽。 其次是可验证性。 候选方案要能通过形式化方法、程序执行、数值计算、模拟器、实验反馈或领域工具做客观检查。 只有前沿而无法验证,系统拿不到可靠训练信号;只有验证但缺乏难度,任务又会迅速落后于模型能力。 二者缺一,数据都会快速贬值。 BigBang团队将科学领域作为模型的训练载体,恰好同时满足前沿性与可验证性两大条件。 它天然组合了搜索、阅读、提出假设、数学推导、代码开发、工具调用、实验分析和结果写作,相当于一套面向通用智能的综合课程。 Jeff Dean说Discovery Loop这条路线适用于有可衡量目标的科学和工程领域,BigBang选科学当训练场,底层逻辑同源。 用可验证的前沿任务牵引数据生产,让数据生产系统跟着模型一起进化,这就是BigBang给出的回答: AI advancing science, and science advancing AI.(AI推动科学,科学推动AI) AI开始决定,下一代AI学什么 把理论答案落为工程实现,BigBang的关键是一套能持续修改和改进自身生产策略的自演化合成数据管线。 它把RSI机制嵌入了训练管线内部,让AI直接参与任务构造、求解、验证、筛选,以及下一轮数据生产策略的优化。 系统的核心,是两类Agent协同工作。 Generator Agent负责不断提出并解决科学、技术及AI研究中的高难度任务。 并非照着固定Prompt出题的生成器,它是作为代码Agent,直接修改、运行和调试数据合成程序。 并且,它还可以调整任务来自哪些科学领域、问题需要多长的推理链、该用搜索还是计算还是代码还是模拟工具,甚至决定哪些样本保留、哪些淘汰、哪些生成策略失败了下轮不再重复。 每一轮实验结束,它还会记录修改动机、实验结果和失败原因,让后续探索继承此前的经验。 Critic Agent则从对抗角度审查候选数据。 第一层看格式、工具执行、数据完整性和约束满足; 第二层进一步判断任务是否正确、可验证、足够困难、多样,并且真正具备训练价值。 过不了审查的任务就被拒绝或回炉,通过的才进入合成数据集。 Generator负责造,Critic负责挑,这套对抗与协作就像AlphaGo的自我对弈,只不过棋盘换成了开放的科学任务空间。 以上是系统的自迭代内循环,但这种快速内循环还有一个隐患。 Generator可...
    行业密探
  • 《仅需》6.9亿个token、423美元和1条提示词,就能做出一款火遍全网的美式水上快艇竞速游戏。
    而且在线可玩,有手就能玩。 网友Vyom如是说。 仔细看看,这个游戏确实挺像模像样。 美式卡通风格、复古街机快艇竞速玩法,有完整的倒计时、圈数和排名系统。 连UI也全部做了统一的硬核街头赛车仪表盘设计,玩起来还挺带感的。 这是用Opus 5、单提示词直出的效果。不得不说Opus 5你还是有点东西。 结果还没高兴两天,另一位网友就在Codex里用GPT-5.6 Sol复刻出来了。 而且只花了5美元!!!
    行业密探
  • 啥?哈萨比斯也想跑路?!
    据Pathfounders援引行业消息人士称,哈萨比斯原本计划和Jeff Dean等人同期离开谷歌。 但是谷歌管理层担心自己股价跌得太惨…于是苦苦挽留哈萨比斯,最终把他劝了下来。 之后,就有了外界看到的这一幕: 哈萨比斯卸任Google DeepMind CEO,升任DeepMind董事长和Alphabet首席科学家。 看起来高升了,但这很可能只是缓兵之计。 哈萨比斯先交出DeepMind的日常管理权,以新头衔留在谷歌,等团队和市场完成过渡,再决定是否彻底离开。 Pathfounders甚至预测,哈萨比斯将在一年内彻底离开谷歌。
    行业密探
正在载入...
正在载入...