LONGGE AI RESEARCH DAILY

龙哥读论文

每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。

目前已发表 1573 篇文章

PaperDaily 数据库收录 论文拆解 12809 研究思路 385 AI 资讯 208 开源项目 164 科研招聘 128 学习资料 8 热点主题 493 论文成功模式 1625

标签:多模态

共 200 篇
快手Kling团队新作:16 FPS实时生成多镜头连贯视频,一个模型搞定生成、参考与编辑
视觉与图像

快手Kling团队新作:16 FPS实时生成多镜头连贯视频,一个模型搞定生成、参考与编辑

告别逐镜头生成的割裂感,快手Kling团队联合清华、南大提出的ContextMaster,把生成、参考和编辑统一进一个模型,在单卡上跑到16 FPS的同时,还能让角色和场景在多镜头之间保持一致。🔍 想看懂这套固定预算稀疏路由怎么在有限算力下留住完整记忆?这篇值得细读。

斯图加特大学:现成CLIP零微调,天生就会预测人类眼动?
视觉与图像

斯图加特大学:现成CLIP零微调,天生就会预测人类眼动?

有句老话叫“所见即所知”,斯图加特大学这篇新作直接把它变成了“所听即所看”:只拿一个现成的CLIP模型做归因,不微调、不标注、不用任何生成架构,就能复现视觉世界实验里经典的预测性眼动——人类听到“eat”还没听到“cake”就把目光移向蛋糕,模型居然也“看”向了同一个地方。

西北工业大学最新研究:图像超分和文字预测一个模型搞定,速度比DiffTSR快101倍
视觉与图像

西北工业大学最新研究:图像超分和文字预测一个模型搞定,速度比DiffTSR快101倍

场景文本超分是OCR落地硬骨头——图要修得漂亮,字还得认得准。西北工业大学等机构提出的DualTSR把图像生成和文字预测塞进同一个Transformer,训练时同步加噪、推理时互相引导,把DifTSR参数量砍掉六倍、速度快一百倍,识别率反而大涨12.78个百分点。一个字:值。

埃默里+芝加哥最新研究:说句话AI就改轮廓,胶质瘤分割DSC涨2.2%
视觉与图像

埃默里+芝加哥最新研究:说句话AI就改轮廓,胶质瘤分割DSC涨2.2%

化疗靶区勾画要改一处轮廓,AI直接"听懂"人话动手改——这是三维医学影像分割基础模型VoxTell与文本指令结合的一次亮眼尝试。冻结全部预训练权重,只训练一个轻量指令分支,就能让模型按临床语言精确编辑亚区轮廓,正确指令在跨数据集测试中比矛盾指令高出0.047的Dice分离度,方向对了。

TAIL2SENSORS:自动驾驶的“物理线索路由”新范式
视觉与图像

TAIL2SENSORS:自动驾驶的“物理线索路由”新范式

自动驾驶里让AI听懂“右前方二十米那辆白色轿车”并不简单,因为颜色、距离、运动速度这些线索分散在不同传感器手里。这篇论文一口气集齐相机、激光雷达和4D毫米波雷达,搞出全球首个三传感器3D视觉定位数据集Talk2Sensors,再配一个TSFormer框架,把强基线甩开8.05 mAP,还让“物理线索路由”第一次有了正经benchmark。做多传感器感知的团队

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球