0.75还是0.50?越南高考凸性评分给大模型评测上了一课
大模型评测几乎都在用“对错”代替“官方评分”,越南2025年高考的凸性评分直接把这种替代打回原形。本文用632道真题和百万考生真实分布,把模型放进人类排名里比了一次,结果让人捏把汗。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
大模型评测几乎都在用“对错”代替“官方评分”,越南2025年高考的凸性评分直接把这种替代打回原形。本文用632道真题和百万考生真实分布,把模型放进人类排名里比了一次,结果让人捏把汗。
这可能是今年最"考古"的AI基础设施工作:哈佛联手波士顿公共图书馆,把1795到1930年的147万份报纸扫描件,变成163亿token的干净文本。更难得的是,整套流水线设计成工作站级硬件就能跑,租服务器全程只要约2.5万美元——相比云端OCR动辄几十万美元的报价,这性价比简直离谱。对做数据工程、LLM预训练和数字人文的人来说,这篇值得细读。
这篇论文盯上了AutoML报告里一个常被忽略的"黑箱":那些没被拟合的候选方案去哪了?北航团队用一套候选命运核算框架,给每个候选一个终态归宿,在三个轴承数据集上找回30-41个被"吞掉"的候选。搞工业诊断、调自动化管线的朋友值得一看。
如果说机械臂是机器人的“手臂”,那灵巧手就是它的“指尖”——能抓鸡蛋、玩叠叠乐、拧瓶盖的那种指尖。但灵巧操作一直是机器人领域的老大难问题:机械臂在工厂里已经干了几十年活了,灵巧手却还在实验室里“装婴儿”。为啥?
人人都说AI要像人一样干活,可它连“等锅汤开要多久”都没概念。根特大学等机构推出Chronocooked强化学习基准,把时间藏在炒菜场景里,逼着智能体靠内在计时做决策。想看AI到底会不会“看表”,这篇论文值得一读。
关系学习热度攀升,但论文复现难、结果对不上。Prior Labs联合斯坦福和NVIDIA,开源基准、模型、接口三件套,把21个任务拉到同一起跑线实测。想看GNN、表格模型和关系基础模型谁是真冠军?这篇值得细读。
音频深度伪造早已不止"语音换脸"——环境声、歌声、音乐都能被AI伪造。这篇ACM Multimedia 2026挑战赛总结,双赛道评测方案与冠军系统一次讲清,音频安全和AI信任方向的从业者值得细读。
AI生成的代码,你敢直接上生产吗?单元测试过了不代表没bug,仓库级形式化验证才是终极保险丝。UC Berkeley等机构提出Vero,要求智能体在一个多模块Lean 4代码仓库里同时写实现和证明,结果最强配置只通关27/43——答案藏在仓库级一致性和共享引理库的组织能力里。
胃镜、CT、化验单、报告,医生从来不是单看一样就下结论。Gastric-X把这个真实逻辑搬进了AI基准:四期CT+内镜+生化指标+报告全部对齐,还配了2.6万条VQA。想让医疗VLM真正学会"综合判断",这份基准值得一读。
临床叙述时间线重建一直被当成“关系分类”来做,单篇报告缺时间锚点就抓瞎。本文用生成器-验证器迭代精炼的思路,配合新基准MedTempo,让大模型把症状先后顺序逐步“捋”清楚,GPT-4.1上EM最高提升9.3个点,思路干净、验证扎实。
你第一眼看到的那种画面流畅、动作丝滑的机器人操作视频,可能只是“好看”,并不是真的“会干活”。上海交大与上海AI实验室等提出的H2R-Bench基准,把11个主流视频生成模型拉到真实的人类演示数据上逐一“体检”,结果发现视频画质与跨实体迁移成功率的相关系数只有0.14。想搞清楚视频生成模型到底能不能帮机器人学数据,这篇必读。
水下照片总是蓝绿蒙蒙一片?印度理工学院这次把海洋光学的"家底"全搬进了合成数据——十种Jerlov水体、深度依赖辐照度、生物荧光一次建模到位。合成数据FID比最强竞品直降46%,四个增强架构跨六个真实数据集全面反超。搞水下视觉的朋友,这份物理知识+数据工程的双拼值得仔细品品。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球