清华最新研究:AI来访者终于学会“不配合”了,5项评分全面领先
清华团队这次不玩虚的,直接把临床心理学里的5Ps公式化、信任分层、多维抵抗机制搬进大模型,让AI来访者从“有问必答”变成“看人下菜碟”。40个临床情境实验、5项人类评估全面领先,AI心理治疗模拟终于有点真实的烟火气了。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1655 篇文章
清华团队这次不玩虚的,直接把临床心理学里的5Ps公式化、信任分层、多维抵抗机制搬进大模型,让AI来访者从“有问必答”变成“看人下菜碟”。40个临床情境实验、5项人类评估全面领先,AI心理治疗模拟终于有点真实的烟火气了。
这篇文章最值得读的地方在于,它第一次把六种基于语言模型的生成式语音增强范式放进同一个框架里公平对比,并同时报告了侵入式和非侵入式两类指标。结论也很干脆:连续域全面胜出,连续非自回归(CNAR)综合最佳。想快速了解这条赛道竞争格局的读者,这份地图比单看某个SOTA更省时间。
η′介子本身也很有故事。它属于赝标量介子家族(和π⁰、η介子是亲戚),但其内部结构比π⁰复杂得多——它的波函数里被认为含有显著的胶子成分(胶子球混合),这使得它的形状因子成为研究非微扰量子色动力学(QCD)行为、特别是η。
大模型写代码已卷到天际,但让它们写“程序规范”(formal specification)靠谱吗?本论文提出COINS框架,用Rocq证明助手评估六大模型的规范生成能力,结果差距惊人:最强Gemini 3 Pro也仅28.05%通过率,DeepSeek-V3.1直接跌到1.22%。想看懂LLM在形式化验证边界的真实水平,这篇是必读。
粒子加速的“幕后黑手”终于被拍到了!帕克太阳探测器在0.24 AU处逮住一颗2800 km/s的极品激波,把它的前兆波场拆成四个波族——原来激波加速能自己“造波”又“用波”,闭环玩得飞起。等离子体天体物理的老经典,这回总算有了实锤。
这篇论文展示了激光微加工在毫米波/亚毫米波天文仪器制造中的首次成功应用:硅基片馈电喇叭阵列不再依赖传统深反应离子刻蚀(DRIE),90/150GHz与350GHz阵列均实现了与DRIE相当的性能。更关键的是,激光微加工无需无尘室,且具备通过多激光并行和厚基片斜壁工艺大幅提升产能的潜力,为下一代CMB实验的大规模焦平面制造开辟了新路径。
你以为只是热带的一场雨,结果它悄悄按下了整个地球大气的“循环开关”。这篇魏茨曼研究所的论文,首次用40年再分析数据证明了MJO这个“季节内振荡一哥”,居然能系统性驱动哈德莱环流产生高达20%强度的异常,而且还滞后4-15天。搞懂它,你就能提前半个月看透热带降雨的“剧本”。
多跳问答里有个坑:第一轮检索到的证据,往往已经暴露了原问题没写明的“桥接信息”,可后续检索却还死死盯着原问题不放。EviReform的做法很直接——看完证据,反手改查询:把没查到的部分写成残差查询,再和原问题一起喂给图检索。结果:三个多跳数据集上,Recall@5最高涨了5.59个点。
做AI的都知道,图像分类这活儿,看着简单,做起来全是坑。尤其是当你把模型从实验室搬到现实世界,面对的不是单一数据集的“温室环境”,而是医疗影像、卫星图、人脸表情、日常物体照片混在一起的“修罗场”。
图像配准要做到亚像素精度,传统傅里叶-梅林方法经常"差口气"。这篇论文把辅助函数方法无缝融入傅里叶-梅林框架,缩放、旋转、平移误差全面下降,还不靠深度学习,适合资源受限的落地场景。
序列推荐(Sequential Recommendation,SR)的任务是根据用户过去买过、看过、点过的一串东西,猜用户下一个最可能想要什么。
CT基础模型很强,但诊断这事,光给个"恶性概率57%"谁敢签字?亚利桑那大学把两个CT基础模型蒸馏成8个放射科概念+结节尺寸的可编辑预测器:内部AUROC 0.86、外部0.73,关键是预测能逐项拆解还能手动干预——AI终于肯"说人话"了。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球