代码审查来了个AI语音裁判:Karpathy带火的技术再立一功
当Karpathy提出的Vibe Coding遇上代码审查,会擦出什么火花?这篇论文用Vibe Coding快速造了一个语音AI代码审查工具,还把它当"挑衅性原型"去研究开发者对AI反馈的信任与协作变化。方法不算深,但思路很妙,适合想低成本用AI做研究探针的同学读一读。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
当Karpathy提出的Vibe Coding遇上代码审查,会擦出什么火花?这篇论文用Vibe Coding快速造了一个语音AI代码审查工具,还把它当"挑衅性原型"去研究开发者对AI反馈的信任与协作变化。方法不算深,但思路很妙,适合想低成本用AI做研究探针的同学读一读。
AI编程智能体越跑越远,需求漂移、过程黑盒、发布甩锅怎么办?港科大(广州)提出的AppLooper,用多智能体协作+版本绑定证据链把整个开发流程钉死,让每一次变更都有据可查、有人负责。值得所有关心AI编程落地与可问责性的读者一读。
音频深度伪造早已不止"语音换脸"——环境声、歌声、音乐都能被AI伪造。这篇ACM Multimedia 2026挑战赛总结,双赛道评测方案与冠军系统一次讲清,音频安全和AI信任方向的从业者值得细读。
表格处理向来是大模型的"老大难":好好的二维表格,硬被拍扁成Markdown字符串,跨表联动全靠蒙。中科大这篇最新研究提出SheetCompass,用层次关系图还原表格的空间结构,配合多智能体协作推理,三大基准全面超车——这波操作,属实有点东西。
把不确定性当成信号而非噪声,用深度学习让万年手印“开口说话”。这套三角验证框架不仅给出预测,还告诉考古学家“这句结论到底有几分把握”。想看看AI和考古学怎么擦出火花?这篇值得一读。
编程教育里最耗人精力的不是写题,而是给题配自动评分器。这篇SIGCSE 2025论文换个思路:让参考答案直接生成评分器,四年近800道题、百万级提交验证过的方案。做编程教育、在线测评、想提升出题效率的都值得一读。
一边是游戏巨头裁员4.4万人,另一边是Steam上独立游戏数量翻倍暴增——AI到底把游戏行业带向了哪里?本论文用硬核数据告诉你:做游戏的成本确实被打下来了,但一个更大的危机,正在悄悄逼近。
AI精神病这个风险,大多数安全评测根本发现不了——单轮测试看每条回答都"正常",30天连续对话却可能亲手养大一套妄想。这篇论文首次用15款主流模型×30天×4位评估员的纵向设计,把幻觉式共谋拆成了四种可量化的轨迹,值得每个做大模型安全的人细品。
别被“多重调和Fock空间”这串术语吓退。这篇论文做了一件很痛快的事:把Toeplitz算子是否落入Schatten类的判定,等价成一个“球内测度质量可积”的几何条件,顺手解决了同行留下的猜想,还证明常数2^p是最优的。数学之美往往就在于:一个模糊的直觉,被证明钉死成精确的结论。
自动驾驶这事儿,有个特别拧巴的现象:你看那些端到端大模型,在 benchmark(标准测试基准)上跑分一个比一个高,可一放到真实世界里,偶尔会像个刚拿驾照的新手一样,干出些让人血压飙升的事儿——比如老老实实闯个红灯,或者。
大模型推理集群的GPU浪费有多严重?这篇来自微软研究院、莱斯大学的系统论文,把扩缩容的“最小颗粒度”从整个模型打碎到单个算子,用毫秒级弹性换回最高36.3%的GPU节省,在A100和GB200集群上都验证了效果。做LLM infra的读者值得细读。
传感器协同跟踪的老问题:摄像头这类高成本传感器,到底该让哪几个节点开机?UCLA这篇论文把“选传感器”当成“做推荐”,用双塔MLP加声学频带特征,在真实外场干扰环境下把命中率从80.4%拉到98.4%,每次决策的在线计算只要约1毫秒。思路跨界又好落地,值得一读。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球