GPT-4也翻车的24点游戏,被ToT一招救活:4%到74%
本文是NeurIPS 2023的经典工作,也是大模型推理研究绕不开的一座里程碑:它把树搜索、自我评估、回溯这些经典AI思想,重新装回了大语言模型身上,让模型面对复杂任务时真正学会“多想几步”。24点游戏4%到74%的跨越,至今仍被反复引用与对比。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
本文是NeurIPS 2023的经典工作,也是大模型推理研究绕不开的一座里程碑:它把树搜索、自我评估、回溯这些经典AI思想,重新装回了大语言模型身上,让模型面对复杂任务时真正学会“多想几步”。24点游戏4%到74%的跨越,至今仍被反复引用与对比。
大模型推理集群的GPU浪费有多严重?这篇来自微软研究院、莱斯大学的系统论文,把扩缩容的“最小颗粒度”从整个模型打碎到单个算子,用毫秒级弹性换回最高36.3%的GPU节省,在A100和GB200集群上都验证了效果。做LLM infra的读者值得细读。
先问大家一个问题:如果你辛辛苦苦搭建了一个光学微腔,结果发现里面的发光分子"抱团"了——吸收光谱变得又宽又丑,发光效率还掉到只有1%左右,你会怎么想?
分数量子反常霍尔效应的微观起源一直是菱方石墨烯领域最大的“悬案”之一。北大团队用STM直接把“跨莫尔轨道”拍了出来——电子隔了六层还能被莫尔界面遥控。这个发现不仅终结争论,还为设计新型拓扑量子平台指了条明路。
大模型跑天气已不稀奇,但这次Ai2把「大气+海洋」整个地球系统搬进AI,单张GPU比超算快40倍,还稳稳复现了400年的厄尔尼诺变率。AI for Science的又一里程碑,值得所有关注气候与AI交叉的读者花五分钟看看。
还在为隐式神经表示(INR)提取拓扑头疼?这篇论文给出一个极简却扎实的思路:只要确保网格边相对底层函数单调,PL网格的临界点就不会“凭空冒出来”。方法不需要复杂的符号计算,纯点采样加细化就能在INR上准确找回临界点,实现又省又稳。
临床叙述时间线重建一直被当成“关系分类”来做,单篇报告缺时间锚点就抓瞎。本文用生成器-验证器迭代精炼的思路,配合新基准MedTempo,让大模型把症状先后顺序逐步“捋”清楚,GPT-4.1上EM最高提升9.3个点,思路干净、验证扎实。
这篇工作把电场驱动液滴从“边看边调”的试错模式,推进到“算好再动”的理论预测模式。中科院、UCL、爱丁堡大学团队联手,用格子玻尔兹曼方法把三相流动与电液动力学完整耦合,还给出了阻力与电力的定量公式——实验误差仅3%,直接可编程。
清华团队这次不玩虚的,直接把临床心理学里的5Ps公式化、信任分层、多维抵抗机制搬进大模型,让AI来访者从“有问必答”变成“看人下菜碟”。40个临床情境实验、5项人类评估全面领先,AI心理治疗模拟终于有点真实的烟火气了。
η′介子本身也很有故事。它属于赝标量介子家族(和π⁰、η介子是亲戚),但其内部结构比π⁰复杂得多——它的波函数里被认为含有显著的胶子成分(胶子球混合),这使得它的形状因子成为研究非微扰量子色动力学(QCD)行为、特别是η。
大模型写代码已卷到天际,但让它们写“程序规范”(formal specification)靠谱吗?本论文提出COINS框架,用Rocq证明助手评估六大模型的规范生成能力,结果差距惊人:最强Gemini 3 Pro也仅28.05%通过率,DeepSeek-V3.1直接跌到1.22%。想看懂LLM在形式化验证边界的真实水平,这篇是必读。
粒子加速的“幕后黑手”终于被拍到了!帕克太阳探测器在0.24 AU处逮住一颗2800 km/s的极品激波,把它的前兆波场拆成四个波族——原来激波加速能自己“造波”又“用波”,闭环玩得飞起。等离子体天体物理的老经典,这回总算有了实锤。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球