竞争比1/2+Θ(1/n)终被证明,算法竟出自LLM之手
这篇论文的价值不在结果本身,而在于过程:一位资深学者和ChatGPT来回讨论几个小时,就给一个悬而未决多年的在线算法问题画上了句号。算法本身只有三行伪代码,但背后是顶会级别的证明思路。对于关心“LLM到底能不能做科研”的读者,这是一份难得的真实样本。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
这篇论文的价值不在结果本身,而在于过程:一位资深学者和ChatGPT来回讨论几个小时,就给一个悬而未决多年的在线算法问题画上了句号。算法本身只有三行伪代码,但背后是顶会级别的证明思路。对于关心“LLM到底能不能做科研”的读者,这是一份难得的真实样本。
大模型测价值观,用问卷、二选一、自由发挥能得出三个不同结论,那测了个寂寞?STONIC用5,144个共享场景和35个模型配置做了一次教科书级的测量审计——既有行为一致性证据,也有“自答偏好”这个反直觉发现,做LLM对齐评估的朋友值得细读。
S波、P波一次算全,电子、缪子两个通道全给到,还顺手把NLO QCD修正做了——这正是BESIII等实验等了好久的理论预言。不同J值态的奇异峰结构和软光子截断敏感性,给重夸克偶素电磁衰变这个老话题开了一扇新窗。
电子晶体管能独立控制载流子密度与输运速率,离子器件却一直被困在"一维控制"里。曼彻斯特大学团队用双门控技术给锂离子输运装上了"双旋钮"——密度归密度,速率归速率,开关比破百,千次循环不衰减。这项成果为储能与离子计算带来了新的想象空间。
这是一篇纯理论推导,却充满"几何直觉"的稀有文章。它不满足于告诉你算法L怎么用,而是用递归树把"为什么这么写"讲得明明白白。哪怕你对格雷码一无所知,也能顺着树的生长看懂指针的每一次跳动。
先花十秒钟想一个场景:一台扫地机器人走进一个从来没去过的房间,它需要知道哪里有桌子、哪里有椅子、哪个是垃圾桶,最好还能知道每件东西具体占了多大面积——注意,是像素级的轮廓,不是一个框就算完。
论文作者Henry Adams在开头写得很坦诚:这个证明是GPT-5.6 Sol Pro在ChatGPT里生成的,他对文字做了编辑, 但没有改动任何数学内容 。
这可能是今年最值得安全协议研究人员读的一篇理论文:把干了四十年的Dolev-Yao攻击者从“能力模型”升级成“激励模型”,让攻击者学会算账,收益小于成本就不攻击。论文证明理性安全可判定,还给出了可计算的阈值,并在支付协议和ThreeBallot投票两个用例中展示了如何“用钱说话”。建议所有做安全协议验证、密码学形式化、投票方案的朋友都读一下。
纯数学也能玩出花样!这篇法国斯特拉斯堡大学学者新作,把3的幂的二进制展开和组合词论绑在一起,证明“简单二进制表示”的3的幂只有有限多个。Schmidt子空间定理与Baker理论双武器联合,看懂证明思路就值回票价。
换根连杆、改个质量,世界模型就“失忆”?清华这项研究把机器人形态参数和可复用动力学分开建模,让世界模型在没见过的新参数下也能零样本预测和规划。想搞机器人泛化的,这篇值得一读。
跑姿分析一直被认为是专业实验室的专利,动辄几十万的设备劝退了大多数人。这篇论文用五个成熟姿态估计模型+后处理,把髋膝关节角度估测误差压到5.3°,还配套了网页演示平台,属于典型的低成本高性价比工作,做运动科学和姿态估计的朋友值得一读。
多智能体语言模型模拟在社会行为研究中越来越流行。但绝大多数评估只问:智能体有没有坚持扮演分配的角色?却很少有人系统跟踪另一个问题: 智能体用来描述自己的身份设定,会不会被它自己在运行中改掉?
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球