LLM开上太阳望远镜?JW-ASTClaw让自主观测真落地了
这篇论文最有意思的地方,不是“又一个大模型接了个工具”,而是它真的把大语言模型塞进了太阳望远镜的实时控制链路里,还跑在了中国日地空间环境监测网的实际设备上。它解决的不是玩具问题,而是云、风抖、活动区、快速耀斑响应这些会直接影响观测价值的真麻烦。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1660 篇文章
这篇论文最有意思的地方,不是“又一个大模型接了个工具”,而是它真的把大语言模型塞进了太阳望远镜的实时控制链路里,还跑在了中国日地空间环境监测网的实际设备上。它解决的不是玩具问题,而是云、风抖、活动区、快速耀斑响应这些会直接影响观测价值的真麻烦。
长上下文这件事,表面上是“把更多字喂给模型”,本质上却是在逼模型做一道很残酷的选择题:到底是要 记得更全 ,还是 跑得更快 ?全注意力模型像个记性极好的学霸,什么都想翻一遍,代价就是上下文越长,算得越慢;RNN 和一批线性/滑窗方案则像记笔记很快的同学,速度稳了,但一长起来就容易把关键线索漏掉。
这篇论文最有意思的地方,不是“能不能遗忘”,而是“遗忘前能不能先把没必要遗忘的删掉”。Apple Research 直接把机器遗忘做成了省算力工程,最高能省下约50%执行时间,思路很实在。
束缚能和原子核半径,表面上是两件事,实际上讲的是同一个核系统的“身体”和“体重”。这篇论文最有意思的地方,不是把公式写得更花,而是用1个参数把全球半径趋势和局部结构一起兜住了。
这篇论文专门盯住一个很阴险的问题:正确答案提前露给模型,训练数据就“看起来都对”,但学生模型还是会被带歪。它不是在讨论玄学,而是用一比特实验把锅精准甩给“答案可见”。
这篇论文最狠的地方,不是把RLVR讲明白了,而是第一次把“训练得不错”推进到“理论上也站得住”。更有意思的是,它不是空谈定理,而是拿出一条Progressive RLVR流水线,把压缩、蒸馏、量化一起拧上,真把泛化界做到了能看、能算、还能落地。
金融问答最怕什么?不是题难,是模型一本正经地把账算错。本文直接把“自然语言讲道理”换成“可执行程序讲道理”,再用执行验证筛掉假把式,7B学生竟然能把72B教师按在地上摩擦,思路很硬,结果也很硬。
这篇不是“又一个理论猜想”,而是把单侧Cl吸附、空穴掺杂、对称性分析和第一性原理算到一起,硬生生把FeSe这类老牌超导材料,改造成了一个可讨论交变磁性的现实平台。更关键的是,620 meV 的自旋劈裂和 10 层 slab 里的鲁棒性,说明它不是纸上谈兵。
这篇论文的思路很直接:既然完整层析又贵又慢,那就别硬算整张量子态,直接把纠缠指标“翻译”成电路测量概率。两比特算 concurrence,三比特算 3-tangle,路线清楚,工程味也不轻。
这篇论文的看点很直接:平面图的 D-染色不是“全局乱卷”,而是被几个局部结构卡住了。作者把小度数、五度数和大度数三段分别拆开,最后把王氏猜想推进到只剩 6 到 32 度这段难啃区间。
DeepSeek 这回不只是把模型跑快,而是把“怎么在边缘设备上少算、少搬、少耗电”拆成了三把硬核手术刀。MIPS、MBLM、DAPPM 三招一套打下来,才有了 28nm 上 109.4 TFLOPS/W 这个挺扎眼的数字。
这篇论文最狠的地方,不是又搞了个“更安全”的协议,而是把单服务器安全聚合里最烦人的中间转发环节直接掀桌子了。再加上 CRT 打包,模型更新不再像背着一整箱砖头跑通信链路,效率提升很实在。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球