史前手印性别识别不再靠猜!三角验证框架准确率达88%
把不确定性当成信号而非噪声,用深度学习让万年手印“开口说话”。这套三角验证框架不仅给出预测,还告诉考古学家“这句结论到底有几分把握”。想看看AI和考古学怎么擦出火花?这篇值得一读。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
把不确定性当成信号而非噪声,用深度学习让万年手印“开口说话”。这套三角验证框架不仅给出预测,还告诉考古学家“这句结论到底有几分把握”。想看看AI和考古学怎么擦出火花?这篇值得一读。
手性自旋液体向来是强关联物理的“圣杯”级物态,但外界条件一变化它会不会垮?清华大学姚宏团队用大规模DMRG数值实验,把位移场这个“旋钮”拧开:手性自旋液体只撑到φ≈0.02π,随后跳出个带长程标量手性的反铁磁姐妹相,中间还可能藏着一个连续相变。一篇paper把相图玩出三种新花样,值得一读。
先补个背景:FCC-ee(Future Circular lepton Collider,未来环形正负电子对撞机)是欧洲核子研究中心(CERN)规划的新一代高亮度正负电子对撞机,束流能量覆盖45.
编程教育里最耗人精力的不是写题,而是给题配自动评分器。这篇SIGCSE 2025论文换个思路:让参考答案直接生成评分器,四年近800道题、百万级提交验证过的方案。做编程教育、在线测评、想提升出题效率的都值得一读。
一边是游戏巨头裁员4.4万人,另一边是Steam上独立游戏数量翻倍暴增——AI到底把游戏行业带向了哪里?本论文用硬核数据告诉你:做游戏的成本确实被打下来了,但一个更大的危机,正在悄悄逼近。
AI精神病这个风险,大多数安全评测根本发现不了——单轮测试看每条回答都"正常",30天连续对话却可能亲手养大一套妄想。这篇论文首次用15款主流模型×30天×4位评估员的纵向设计,把幻觉式共谋拆成了四种可量化的轨迹,值得每个做大模型安全的人细品。
Wilf猜想悬了46年,是数论与半群理论交界处最倔强的钉子户之一。这篇论文没把它彻底拔掉,却用两个"缺陷"把Wilf数拆成精确恒等式,还把猜想归约成一个不含导子c和n的漂亮不等式——顺手纠正了Kaplan分类中漏掉的一大族反例。想感受纯数学里"拆解+归约"的功力,这篇值得细读。
自动驾驶这事儿,有个特别拧巴的现象:你看那些端到端大模型,在 benchmark(标准测试基准)上跑分一个比一个高,可一放到真实世界里,偶尔会像个刚拿驾照的新手一样,干出些让人血压飙升的事儿——比如老老实实闯个红灯,或者。
自动驾驶这事儿,有个特别拧巴的现象:你看那些端到端大模型,在 benchmark(标准测试基准)上跑分一个比一个高,可一放到真实世界里,偶尔会像个刚拿驾照的新手一样,干出些让人血压飙升的事儿——比如老老实实闯个红灯,或者跟前车亲个嘴儿。😒 这就很离谱了。龙哥经常说,平均分高不代表安全,真正的安全是那些极端情况下的表现。今天要聊的这篇论文,就是给这些"高分低能
本文是NeurIPS 2023的经典工作,也是大模型推理研究绕不开的一座里程碑:它把树搜索、自我评估、回溯这些经典AI思想,重新装回了大语言模型身上,让模型面对复杂任务时真正学会“多想几步”。24点游戏4%到74%的跨越,至今仍被反复引用与对比。
先问大家一个问题:如果你辛辛苦苦搭建了一个光学微腔,结果发现里面的发光分子"抱团"了——吸收光谱变得又宽又丑,发光效率还掉到只有1%左右,你会怎么想?
分数量子反常霍尔效应的微观起源一直是菱方石墨烯领域最大的“悬案”之一。北大团队用STM直接把“跨莫尔轨道”拍了出来——电子隔了六层还能被莫尔界面遥控。这个发现不仅终结争论,还为设计新型拓扑量子平台指了条明路。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球