一水
来源:量子位
爆料直指霍奇猜想
OpenAI的纳维-斯托克斯方程连续剧,居然还没完。。。
《纽约时报》最新追访,补出了这场冲突中此前没有披露的细节。
其中最关键的一条,是OpenAI更新了关于用户数据的说法:
这比OpenAI此前 “无法完全排除匿名用户数据曾帮助改进模型” 的表态明确得多,也给8月研究成果是否进入模型划出了一条时间线。
不过这仍然是OpenAI单方面给出的说法,目前没有公开技术材料可供外界独立核查。
数据争议还没落地,OpenAI又扔下一枚炸弹:
攻克纳维-斯托克斯之后,公司又在另一道千禧年大奖难题上取得“实质性进展”,正在准备公布结果 。
而最新传闻指向的,正是霍奇猜想。
好家伙,第一道题的论文还在接受审查,第二道题已经要交卷了。
简单回顾一下这场争议始末以及最新爆料。
纽约大学数学家Tristan Buckmaster称,在自己拒绝OpenAI提出的合作方案,并表示可能公开双方的沟通经过后,OpenAI研究负责人Sébastien Bubeck对他说:
Buckmaster反问,公开事实怎么会毁掉一名学者的职业生涯。对方又称:
Bubeck后来承认第一句话确实出自自己之口,但否认是在威胁 。
他随后晒出自己与Buckmaster合作者Levent Alpöge的聊天截图。
截图显示,Bubeck在电话前提出协调双方发布、承认两人的研究优先权,并愿意分享证明和人类提示词。
但这些消息只能证明OpenAI在电话前释放过合作意愿,无法还原真正引爆冲突的通话。
《纽约时报》此次补出的,是那场谈判更完整的条件 。
当时OpenAI已经完成纳维-斯托克斯证明,而Buckmaster和Alpöge只推进到了更简单的欧拉方程。
OpenAI向Buckmaster提供了几种选择:
需要说明的是,OpenAI不是要直接支付100万美元,也没有证据显示双方讨论过封口协议。
这里指的是OpenAI愿意公开推荐奖金归属。
但Buckmaster仍然觉得,OpenAI是在“收买”自己。
症结就在他的合作者Alpöge身上 。
Alpöge虽然任职于Anthropic,但这项研究是他的个人业余项目,并非Anthropic发起。
可Bubeck在接受《纽约时报》采访时直接确认,OpenAI确实不希望Alpöge出现在最终论文中:
Buckmaster则认为,两人的研究既使用了Anthropic的Claude,也使用了OpenAI的codex,最合理的办法应该是两家公司放下竞争,共同处理这项成果。
他形容,OpenAI无法理解自己为什么不接受这笔交易,也无法理解他为什么不愿意“把Levent扔到车轮底下”。
Bubeck对此同样感到不解。
他告诉《纽约时报》,OpenAI此前完成其他数学证明后,也曾与外部数学家达成过类似合作安排,因此他对Buckmaster拒绝合作的反应感到惊讶。
至于“毁掉职业生涯”的警告,Bubeck给出的语境是:
Buckmaster表示,只要OpenAI公布证明,就会立即向媒体提出一系列指控。
他真正想问的是,为什么要用未经证实的指控冒险损害自己的职业生涯。
Bubeck承认这是“极其糟糕的措辞”,称自己当场收回并道歉。
但Buckmaster显然没有感受到其中的“善意”。
周日,他把纽约大学的办公室变成了一间临时“作战室” :
黑板上写满事件时间线,几名同事坐在旁边,和他一起讨论该怎么应对。
他还给普林斯顿高等研究院数学家Peter Sarnak打了电话。Sarnak听完双方提出的条件后表示:
他同时称赞Buckmaster“按照数学家的方式行事”。
周一接近午夜,Buckmaster仓促公开了三篇尚未来得及充分润色的论文,以及一份1870词的事件说明。
直到凌晨2点30分,他才离开办公室回家。
几个小时后,OpenAI正式宣布完成纳维-斯托克斯证明。
而这场争议真正刺痛数学家的,也许还不只是数据。
Buckmaster认为, 在争吵中被忽略的,是人类数学家为这次突破铺出的道路 。
几年前,西班牙数学家Diego Córdoba和Luis Martínez-Zoroa提出了一套攻击相关流体方程的新策略:
Buckmaster负责设置问题,Alpöge将问题输入Anthropic的模型。
两人再根据模型输出不断反馈、修正,逐步解决更复杂的方程。
Buckmaster因此强调:
按照过去的研究节奏,这套方法本可以由不同数学家继续接力,或许再用十年时间走到纳维-斯托克斯。
但现在,OpenAI调动上万个Agent,把这段路压缩到了几天。
一边是前人用几年时间提出核心策略,另一边是AI用海量算力完成最后冲刺。
那么,这项突破究竟应该算谁的?
这个问题还没有答案。
但我们能看到的是,OpenAI已经开始刷下一道了。。。
最新爆料称,OpenAI已经把下一个目标锁定在了 霍奇猜想 。
早在纳维-斯托克斯结果公布前,Epoch AI数学负责人Elliot Glazer梳理当时混乱的消息源时,就提到一名数学教授从所谓“可信渠道”听到:
被攻克的不是纳维-斯托克斯,而是霍奇猜想 。
当时这条消息被视为传闻中的传闻。
如今OpenAI确认又在一道千禧年难题上取得“实质性进展”,这条旧线索也被重新翻了出来。
虽然是不是还有待两说,但种种传闻已经让它成为目前呼声最高的答案。
那么,霍奇猜想到底在猜什么?
简单来说,它试图在数学的两个世界之间搭一座桥。
一个是拓扑学,关注高维空间整体上有多少个“洞”。
另一个是代数几何,研究由多项式方程刻画出来的几何形状。
霍奇猜想认为,在一类特定的复杂几何空间中,那些由拓扑学发现的特殊“洞”,并不是凭空存在的,它们背后应该都能找到由代数方程构成的几何结构。换句话说:
这个猜想由英国数学家William Hodge在20世纪提出,后来被列入七大千禧年大奖难题。它连接了拓扑学、复几何与代数几何,也是现代数学最核心、最难啃的问题之一。
而可能挑战它的,仍是那个没有正式名字的OpenAI内部模型 。
OpenAI目前只透露,该模型从8月28日开始训练,数学能力已经显著超过GPT-6 Astra,甚至在纳维-斯托克斯项目进行期间,它还没有结束训练。
外界则传言,它的代号可能是,但这一名称尚未获得OpenAI证实。
就是这个“边训练、边刷题”的模型,被接入一个由上万个Agent组成的系统,同时尝试多道尚未解决的千禧年难题。
OpenAI披露,整轮测试产生了490万条Agent消息和约3000亿个输出Token,其中仅纳维-斯托克斯一题,就动用了约1万个并行Agent,产生270万条消息,消耗约1300亿个输出Token。
从Agent启动到找到解法,只用了88个小时,随后GPT-6 Astra又花费17个小时完成Lean形式化和验证。
纳维-斯托克斯,只是这套暴力解题系统公开交出的第一张答卷。
现在,第二道题也已经在路上了。
把最近半个月的消息放在一起看,会发现这并不是一次偶然的数学突破:
更像是一场被传闻点燃、迅速升级的AI刷题竞赛 。
事件的主角当然是OpenAI和Anthropic这对宿敌,双方瞄准的还都是千禧年难题这种数学界的“终极Boss”。
(七道千禧年难题中,此前只有庞加莱猜想获得正式解决,如果OpenAI的纳维-斯托克斯证明最终通过审查,那就还剩五道了。)
这场大战究竟有多夸张,一张表格看明白:
最兴奋的当然是,许多困扰人类几十年甚至上百年的问题,可能会被快速推进。
但对数学家而言,另一面也很真实:
他们提出问题、积累路线、把未公开草稿交给AI工具,最后却可能发现,工具背后的公司正在与自己抢跑。
Buckmaster说, 他并不在意100万美元奖金,只是热爱数学,想成为这段历史的一部分 。
如今,他确实进了历史,只是方式和他想的完全不一样。
面对《纽约时报》,这位数学家说:
版权所有,未经授权不得以任何形式转载及使用,违者必究。阿里的千问系列模型与OpenAI的GPT系列模型各有特点,在不同方面展现出不同表现。 一、模型架构与技术基础阿里千问系列模型基于阿里自身的技术研发体系构建,融合了大量阿里在云计算、大数据等领域积累的技术优势。 它针对中文语境和国内用户需求进行了优化,在处理中文文本、理解中国文化和商业场景等方面有一定的先天优势。 例如在电商、物流等相关领域的文本理解上可能会表现得更为精准。 OpenAI的GPT系列模型则以其先进的Transformer架构闻名,它在大规模无监督学习方面有着深厚的积累,在英文文本处理上有着卓越的表现,能够生成连贯、富有逻辑的英文内容,在全球范围内被广泛应用于多种自然语言处理任务。 二、语言理解与生成能力千问系列模型在中文语言理解和生成上能够较好地贴合国内用户习惯和需求。 对于一些具有中国特色的词汇、文化典故等能够准确理解并生成合理的回应。 在一些国内特定行业的专业文本处理上,如中医药领域的术语理解和相关文本生成,也有不错的表现。 GPT系列模型在语言生成的多样性和创造性方面表现突出,尤其在英文文本生成上,能够产出丰富多样且质量较高的内容,无论是故事创作、论文撰写还是对话模拟等任务,都能展现出强大的语言生成能力。 在跨领域知识融合生成方面也有很好的表现,能够综合不同领域知识进行高质量的内容创作。 三、应用场景拓展千问系列模型凭借阿里庞大的业务生态,在电商客服、智能物流调度、企业内部知识问答等场景有着广泛的应用前景。 它能够快速理解并处理与阿里业务相关的各类问题,为企业提供高效的智能服务支持。 GPT系列模型在全球范围内被广泛应用于科研辅助、内容创作平台、智能办公等多个领域。 其在英文科研文献理解与辅助写作方面表现出色,帮助科研人员快速梳理文献、撰写论文。 在一些国际知名的内容创作平台上,也有不少创作者利用GPT的语言生成能力来丰富创作内容。 总体而言,两者都是优秀的语言模型,在不同的语言环境、应用场景下各有所长,随着技术的不断发展,它们也都在持续进步和完善。
OpenAI被曝在FrontierMath基准测试中提前获取测试题,引发造假争议,具体情况如下:
OpenAI发布官方AI生成文本分类器,量子计算大神Scott Aaronson参与其中
OpenAI近期发布了一款官方的AI生成文本分类器,旨在帮助识别文本是否由AI生成。 这一工具的发布,反映了随着AI技术的快速发展,对于区分人类与机器生成内容的需求日益迫切。
一、AI生成文本分类器的背景与需求
ChatGPT等AI工具的强大功能,使得它们在做坏事时也能展现出高效率。 因此,开发一种能够准确识别文本是否由AI生成的分类器或检测模型,成为了当前的一种刚需。 在此之前,市场上已经存在一些类似的工具,如GPTZero和斯坦福大学的DetectGPT。 然而,OpenAI作为AI领域的领军企业,其官方工具的发布无疑将进一步提升这一领域的准确性和可靠性。
二、OpenAI官方AI生成文本分类器的特点
OpenAI的这款分类器是一种语言模型,它针对同一主题的人工文本和AI文本对的数据集进行了微调。 数据集来源于人类编写的各种来源,如预训练数据和提交给InstructGPT的人类演示。 分类器将每个文本分为提示和响应,并根据这些提示生成来自不同语言模型的响应。 为了保持较低的误报率,分类器调整了置信度阈值,只有在非常有信心的情况下才会将文本标记为可能是AI编写的。
然而,从官方博客的介绍来看,这款分类器的效果还不够完美。 在对英语文本“挑战集”的评估中,分类器正确地将26%的AI编写文本识别为“可能是AI编写的”,但同时也错误地将9%的人类编写文本标记为AI编写的(误报)。 此外,分类器的可靠性通常会随着输入文本长度的增加而提高。 与OpenAI之前发布的分类器相比,这个新的分类器在来自更新一些的AI系统的文本上的可靠性要高得多。
三、量子计算大神Scott Aaronson的参与
在OpenAI官方AI生成文本分类器的作者名单中,出现了一个熟悉的名字——量子计算大V、德克萨斯奥斯汀分校的Scott Aaronson。 他的个人网站上确实写着目前休假,到OpenAI工作,从事AI安全性的基础研究。 Scott Aaronson的加入,无疑为这款分类器的研发增添了更多的专业性和可靠性。
四、图片展示
五、总结与展望
OpenAI官方AI生成文本分类器的发布,是AI技术发展的一个重要里程碑。 它不仅满足了当前对于区分人类与机器生成内容的需求,也为未来的AI安全性和可靠性研究提供了新的思路和方法。 尽管这款分类器还存在一些不足和局限性,但随着技术的不断进步和研究的深入,相信它将会变得更加完善和准确。 同时,我们也期待Scott Aaronson等更多专业人士的加入,共同推动AI技术的健康发展。