2026-08-03
观察思考:注意力与信息噪音
想调整生物钟的一天,睡不着,于是就顺势起床,强撑着明晚再睡了。现在是 2026 年 8 月 3 日的凌晨五点钟,刚才在床上辗转反侧的过程中产生了以下思考:
-
去噪很重要,现在的搜广推算法(尤其是b 站)就试图用一个又一个的评论区、跳转链接和搜索框去剥夺我们的注意力,可能今天是关于某款感兴趣的游戏,明天又是某个真人秀的明星(前段时间看的白鹿,今晚看的《中餐厅》上的张雅琪)又出现了若干具有争议性的行为,接着被剪切成切片;后天又会是跟vibe coding 相关的一些教程,但无论是博主还是平台,他们想要的只是自己的既得利益,用你的注意力和时间去换取他们想要的舆论导向,获得他们想要的东西。而 vibe coding 这类的教程或者分享博主其实也是东搬西抄,因为短视频这东西不像论文,他要有卖点,并且他要学会制造焦虑,且不存在查重这一类的手段去去除同质化的信息。可能你刷到的 N 个视频,背后都是在讲同一个东西只是不同的说法。
-
习惯很重要。刚才在床上定好了三项定值习惯:每天要喝 2L 水、每天启动一件自己不喜欢干的但有 DDL 的事情(比如最近的 PPT 制作),并且要联系三名好友,不管是通过什么方式;除此之外,还想追踪一些二值习惯。
设计思路:开发笔记-知识库-taxonomy初步构思
现在的开发在我的理解中可以归为五大类,我现在在开发,其实算是第一大类。如下表所示,在这个维度下,我就会去想,能不能把博客或者知识库也这样分类,按照这六类产品的存在逻辑去进行分类。然后每一大类又分为三大部分:基础知识(包括学习路线、常用工具、技术原理架构和实现)、典型案例(好的项目实战、技术分享博客)、学习资源(不同模态不同渠道的学习资源整合,包括未转录的碎片信息)
思考一下文件树的重建,一级分类代表主轴(一级目录)、二级分类代表副轴(二级目录)
- 综述-基础知识(包括学习路线、常用工具、技术原理架构和实现)
- 典型案例(好的项目实战、技术分享博客)
- 学习资源(不同模态不同渠道的学习资源整合,包括未转录的碎片信息)
2026-08-04
观察思考:信息垃圾场与个人知识树
互联网已经变成了巨大的垃圾场,不同模态、不同渠道的垃圾从不同的自媒体博主依据不同的模板传到不同平台,但这个垃圾场里面也有很多金子和宝藏,可是并不是所有的金子和宝藏都适合我们自己,可以先 search,然后 select,接着 think,最后才是 learn,一定要找到属于自己的那颗树,这棵树会经历很多次剪枝,但一定要有推翻重做的勇气,比如原来从 notion 迁移到obsidian,再从 obsidian 到 astro
2026-08-05
观察思考:信息生命周期与科研注意力
第一点想阐述的观点是:当前互联网上的很多模态信息都存在一个生命周期。比如一些搬运的教程、真人秀的吃瓜,再比如一些搞笑的二创,它们只会在一段不等的时间内给大众带来情绪价值,并吸引一部分人的注意力去跟随。于是我就在想,是否在科研中也会有一套这样的理论,即有一些表征、信息或者损失,也是存在生命周期的。我只需要找到这个合适的生命周期,这样才能更准确地去分配模型的注意力。
设计思路:Vcaptions 与多模态内容生产
我学到了一个很好用的插件叫做 Vcaptions。Vcaptions 可以生成实时字幕,有了这些字幕,就可以很好地丢给 Agent 去读。Agent 不仅可以去读,还可以用来进行文生图,从而实现:字幕到图像和视频的输出比如下面这个就是一个别人通过视频提取字幕,字幕丢给 chatgpt 生图得到的效果图。
2026-08-08
观察思考:爱情、选择与幸福
今天看了一个关于“关于爱情和幸福的一些思考”的视频(视频链接)。它真正想讨论的不是“遇到更好的人后能不能分手”,而是“什么才叫爱”。我觉得里面有几个观点很清楚:
- 爱不是放纵感觉,而是责任与克制。 如果只是因为在别人身上发现了自己爱慕的点,就把这种心动当成爱,顺着感觉走的爱情很容易变成“自我中心的爱”和“放纵的爱”。当感觉消失后,人会说“我不爱你了”,甚至觉得是对方变了,但其实可能是自己变了。所谓“更好的人”,有时只是新的刺激,不一定意味着新的关系更值得选择。
- 人的底线和欲望会不断变化。 视频用“50 万一年包养”和“500 万一年包养”的玩笑说明,我们以为不会突破的底线,可能会“一破再破”。如果把爱情建立在条件、比较和感觉上,判断标准也会跟着变化,永远会有下一个看起来更好的人。
- 不要在追求完美中错过眼前的美好。 “麦田摘麦穗”的故事麦田摘麦穗把它说得很具体。视频把它概括为:“总在追求完美中错过眼前的美好。”这对应的就是不断比较、不断等待更优选项的爱情。
- 婚姻是权衡之后的选择,是接受不完美。 “树林砍树”的故事树林砍树说明,这里的妥协不是随便将就,而是不再执着于“极致完美”,承认每个人都有优点和缺点。
- 幸福来自不再摇摆,并且珍惜自己的选择。 “田野摘花”的故事田野摘花说明,幸福就是“遵从内心的选择,珍惜当下所拥有的时刻”。
- 真正的爱里不存在比较级。 视频最后用小猫作比喻:即使自己的猫“臭臭的,爱打呼,爱放屁,还爱掉毛”,也不会因为宠物店里有一只看起来各方面更好的猫,就把原来的猫丢掉。因为“你是你,在我身边,你就是最好的那一个”。
这段话最后落到一句很有力量的话上:
心不定永远都有更好的,心定了眼前就是最好的。
观察思考:关系中的责任与比较
后面这段文字把同一个问题讲得更具体,也补充了一个很重要的区分:可以因为现任不好而分手,但尽量不要因为别人更好而分手。
它首先用一个大学宿舍里的故事说明,选择一个人之后,就应该对这段选择和对方付出的青春负责。女朋友并没有做错什么,也可能曾经为了这段关系拒绝过更好的人;因此,不能只因为出现了一个外在条件更好的人,就忘记原来关系里的投入。正如宿舍长说的:“既然你当初选择了她,就要有所担当。”宿舍长的回答
接着,它把爱情分成了两种:一种是看到漂亮的人就想追、被拒绝后又不甘心的本能刺激;另一种是经过时间和经历沉淀,两个人风风雨雨之后,把对方当成“今生的选择”,愿意共同经营、共同承担责任。前一种更接近欲望和新鲜感,后一种才是成熟的爱。两种爱情
所以,用一时的本能冲动去颠覆长期经营出来的感情,是用低阶的刺激摧毁厚重的爱。这里最有价值的不是劝人无论如何都要坚持,而是区分了两种分手心态:因为现任不好而分手,是“避害”,是在尽力尝试后发现经营不起这段感情,于是止损,是对自己负责;因为别人更好而分手,则是“趋利”,容易被贪婪支配,逐渐丧失责任感。避害与趋利
这段话和前面的视频最后落到了同一个地方:永远有人会更好。如果始终把伴侣当成可以比较、升级和替换的选项,比较就不会结束;只有在选择之后愿意承担、经营和确认,眼下的人才会成为“最好的那一个”。
- 操作搜索框、输入关键词并回车搜索;
- 上下滚动,触发懒加载;
- 提取商品名称、规格、价格、补贴、店铺、销量和链接;
- 排除广告、二手商品,比较自营与第三方商品。
观察思考:老年痴呆与世界模型
今天回去横县看了阿婆,确实感觉智力回到了小孩水平,于是思考——建模老年人眼中的世界模型是否对老年痴呆有帮助 , 关于老年痴呆人群对话的数据集是否有现成的,还是要去采集呢?
观察思考:世界、数据、知识与意识
今天想到了一些世界观,不知道对这个世界模型会不会有帮助,但是这个东西一定要整理到某一篇综述里面 :世界是实体与关系的场,我们通过数据记录它→知识建模它→意识感受它,而数据是世界的有损投影,知识也需要有不同的展示形态,每种展示形态可以看作是知识的有损投影,而所有的数据(文件)都是字节流(0和 1),但同样也需要不同的展示形态
2026-08-09
设计思路:相册的叙事结构与视觉节奏
实体印刷册的规格——16 折 34 面,就是封面封底各 1 面 + 内页 32 面
| 面数/章节 | 内容主题 | 照片或素材建议 | 文字/设计提示 |
|---|---|---|---|
| 封面(1 面) | 我们的故事:从相遇到未来 | 1 张主视觉合照,或两人的剪影、手部等具有象征性的细节 | 标题、两人姓名与纪念日期简洁排版,保留呼吸感,不堆叠信息 |
| 第一页到第四页 · 第一章:相遇 | 第一页、第二页、第三页、第四页 | 初遇地点、当时的生活照、旧物或地点照片 | 用时间、地点和一句旁白建立故事起点;可用时间轴或地图元素 |
| 第五页到第八页 · 第二章:初识与心动 | 第五页、第六页、第七页、第八页 | 早期合照、聊天记录、第一次约会或共同去过的地方 | 文字以片段和对话为主,照片大小错落,呈现关系升温 |
| 第九页到第十二页 · 第三章:确认关系 | 第九页、第十页、第十一页、第十二页 | 确认关系前后的合照、纪念日照片、当时的票根或小物 | 突出一个明确的日期或事件,可设置一页大图作为章节情绪点 |
| 第十三页到第十六页 · 第四章:日常相伴 | 第十三页、第十四页、第十五页、第十六页 | 日常抓拍、生活环境、食物、宠物或共同使用的物品 | 不追求每张都精致,保留真实感;穿插短句和留白页 |
| 第十七页到第二十页 · 第五章:一起去过的地方 | 第十七页、第十八页、第十九页、第二十页 | 旅行主视觉、风景、路线截图、车票或门票 | 按地点或时间编排,避免变成景点合集;用地图、日期作辅助信息 |
| 第二十一页到第二十四页 · 第六章:经历与支持 | 第二十一页、第二十二页、第二十三页、第二十四页 | 情绪真实的合照、陪伴瞬间、手写字条或重要聊天片段 | 少放“事件说明”,多写当时的感受;版式适当收紧后再释放留白 |
| 第二十五页到第二十八页 · 第七章:此刻的我们 | 第二十五页、第二十六页、第二十七页、第二十八页 | 近期最喜欢的合照、各自的肖像、家中或熟悉场景的细节 | 以一组统一风格的照片作为主视觉,配一段总结性的文字 |
| 第二十九页到第三十二页 · 第八章:写给未来 | 第二十九页、第三十页、第三十一页、第三十二页 | 想去的地方、想完成的事、象征未来的空镜或两人背影 | 以写信、愿望清单或“未来的我们”收束,最后一面可保留大面积留白 |
| 封底(1 面) | 故事暂时写到这里 | 1 张收尾细节照,或仅使用日期、地点、短句 | 与封面形成呼应,信息克制;可放制作日期或一句只属于两人的话 |
选材原则:成品照片控制在约 35–50 张,组合主视觉合照、关系推进中的合照、日常抓拍与生活细节;不必每面都放照片,保留文字页、留白页和票根/聊天记录等素材,让节奏从“相遇”自然推进到“现在”,再落到“未来”。
2026-08-10
设计思路:项目复现思路
以下是现有的explore项目复现思路
2026-08-11
观察思考:从想法到实体
今天想到一个观点:现在的很多东西都是从想法到实体。以前,从想法到实体的周期可能需要很长;但现在有了 AI,可以让这个时间越来越短。
不管是做科研工作、实现一个课题,还是做出一个可交付的网站,模型在这个过程中都可以提供加速:
- 加速对基础知识体系的构建;
- 加速对技术选型的了解;
- 加速代码,甚至一些硬件代码层面的书写。
观察思考:身体、想法与知识
这个时代,好像想法更重要。但在医学的现有条件下,身体才是革命的本钱,身体大于想法大于知识,或者说身体远大于想法和知识。所以现在赶紧去睡觉。
观察思考:权力边界与人性
人性最大的恶就是在自己最小的权力范围内最大限度地为难别人,来源为女子觉得别人按电梯的工作轻松,发红薯曝光,结果导致别人丢掉工作
2026-08-14
观察思考:短视频的信息加工链
一种信息被加工为多种模态,首先你看到的是图像和音频/视频,接着你点开了评论区/相关搜索/标签(文字模态),然后在评论区找到了与自己想得差不多/很有意思/有攻击性/建设性/引战的观点,于是继续深挖(得到正反馈,多巴胺持续释放),可是大脑又不愿意深挖和处理这些信息,觉得大拇指下滑去输入下一条信息更轻松,于是你就进入了下一个循环。总结来说短视频(b、抖、红)为什么更容易吸引人注意力,我认为是因为:
观察思考:多模态与注意力循环
- 信息呈现为多模态,尤其是视觉模态
- 信息不需要经过任何加工和处理,只会在脑子里停留很短暂的生命周期,大脑觉得很舒服
2026-08-16
观察思考:模型路由与任务路由
- 模型需要路由,opencode把活派给不同的agent,让主agent上下文更干净,每个子 agent 目标更明确
- 任务需要路由,就想今天记的本地任务分配路由,简单数据信息处理给 codebuddy,负责多模态数据信息处理给 opencode,再复杂点的带视觉验收的任务给 codex,这也会极大得提高效率和上下文的干净程度
观察思考:建议、帮助与自尊
好像我之前就是做的不是很好,之前修监控的时候就感觉到了,每个人都有自己需要帮忙,需要他人指出错误,给出建议的时候,但是如何帮忙和给出建议,让对方能感受到得善意大于恶意,也是一门很大的学问
2026-08-18
观察思考:信息对称与沟通效率
- 信息越接近对称,双方的沟通效率越高,激进一点的断言是:信息对称是有效沟通的前提
观察思考:500万不是退休通行证-从大厂辞职到半退休生活,关键是保留做事与重新出发的可能
最近从一段关于“500 万存款能否支撑半退休生活”的视频里看到一个讨论,觉得很值得记录下来。500 万当然能带来很大的安全感,但它更像是一块厚实的缓冲垫,而不是一张保证余生无忧的通行证。存量资产存量资产可以降低对工资的依赖,却未必能替代生活本身的方向感。
所以,辞职更像是一次需要准备软着陆软着陆的转身,而不是从工作状态直接跳进退休状态。可以先降低工作强度,尝试独立游戏、短期项目、自由职业或其他更松弛的工作方式,让收入、节奏和心理状态都有一个逐步调整的过程,也给自己留下重新进入职场或调整方向的空间。
持续做事,也不等于必须持续赚钱。开发独立游戏、做一段时间咖啡师、骑行、阅读,或者和高校学生交流,都未必需要立刻转化为收入,但可能让人保持思考、创造和与世界接触的能力。这些事情能够提供价值感价值感,让生活不至于只剩下消费时间。重要的不是把退休重新包装成另一种绩效考核,而是保留自己愿意投入的事情。
这种能力也来自自律和社会连接社会连接。没有外部工作结构之后,时间会突然变得宽松,但宽松并不自动等于自由。自由职业的自我管理自由职业的自我管理,要求人在没有打卡和组织监督的情况下,主动安排时间、任务和休息。如果夫妻长期关起门来生活,生活半径生活半径和社会关系逐渐缩小,原本被工作分散的问题也可能重新浮现,甚至让亲密关系承受更多压力。
至于去云南生活,也不必一开始就把它设想成永久迁居。可以先短租几个月,按照真正的日常去验证气候、医疗、交通、采购和社交是否适合自己,也观察离开原有生活圈之后的感受。甚至可以根据季节在不同地方生活,把云南当作一个长期试验,而不是一次性做出的终身决定。
从这个角度看,退休并不是彻底停止工作,而是逐渐获得选择权:可以选择做什么、做多久、为不为钱而做,也可以选择什么时候停下来休息。半退休半退休也许比“从此什么都不做”更接近理想状态——保留一部分行动和连接,同时把更多时间交还给自己。500 万真正能买来的,或许不是一辈子不必工作,而是在不喜欢的工作面前,拥有说“不”的底气。
2026-08-20
观察思考:对未知的恐惧会限制发展
- 对掌握新技能:语言类、艺术类、运动类-到达每个水平的难度,需要投入的时间和精力未知
- 对使用新技术:语言,框架,工具-未知的试错成本和未知的收益,跳出舒适圈需要勇气
- 对人:陌生人,没那么熟的新朋友,职场等-未知的反馈,不知道释放友好信号后对方的反应会是什么
观察思考:我眼中的南宁-10个词描述
- 7/10 个词:奶街、粉、夜市、慢悠、糖水、烧烤、电动车
2026-08-21
人生节点:2026 年 8 月 21 日,90 岁
奶奶今早走了,梦里走的,应该没什么痛苦。8 月 8 日回去看的时候已经像个小孩一样了,说什么都不记得我们了,阿尔兹海默症应该都是会像小孩一样的吧,小孩子睡一觉就走了,应该不会有太大的痛苦的。至少我们那天说话的时候她还笑呵呵的,没啥念想和遗憾了,当时还说要常去她家看看,蛮好的,以后会回去看看的,要带着过马路回去看看她。
⚠️观察思考:即时满足、算法放大与创作者迎合:视频生态中的劣币挤压良币
信息过剩的时代背景下,视频生态越来越受到注意力经济影响。统计和研究表明情绪内容更容易抓住注意力,而冲突和道德判断更容易引发评论与站队,而这些行为又会被算法识别为“用户感兴趣”,获得更多推荐,同时这个反馈循环会让创作者更倾向于制造情绪和对立。
于是就有了以下恶性循环:起点为用户的即时满足倾向,推荐算法放大倾向,创作者和传播者迎合倾向。更容易获得点击、评论和传播的劣币会挤占良币的生态,用户刷到劣币的概率变大,他们刷多后产生一系列的负面影响,即时满足倾向继续被放大,完成恶性循环的闭环。
观察思考:成瘾与戒断
个人认为,容易让人成瘾的东西都可能有以下特点
- 情绪绑定:焦虑、孤独、压力后就会触发这些行为
- 即时满足奖励:偏好小奖励和情绪满足,而不是长期收益和自我提升
- 对新奇与不确定性的追求
- 低门槛和高可得性:随时能打开、几乎不需要成本,也会大幅增加使用频率。
- 让人耐受降低:重复后刺激变弱,于是需要更久、更新奇或更强的内容才能获得相似满足。
情绪绑定是触发条件,而4 则让触发变得容易,2、3、5让触发后停不下来
2026-08-22
⚠️观察思考/设计思路:与其改变别人的世界模型,不如理解别人的世界模型
我的课题研究思路设计:
- 世界模型之前的人工征尝试去表征世界
- 世界模型尝试去还原世界。
- 模型可解释性分析(韩师姐组会上的想法:维基百科是一个库的话,GPT 是不是一个更大的库?)尝试去理解世界。
tips:不一定从深度学习的方法去做,一定是要多看多想多学,但是主线定在这里了,那就应该围绕主线去想问题。
人生节点:生与死-红白布,芭蕉树,孟婆汤,奈何桥,大火,红绳,利是,火化,坛子,净屋
昨天的印象浓缩成了这几个词,阿婆走过这一遭也算是体面地走了,想知道人死后的世界究竟是怎么样的,说不定阿婆现在已经在哪里出生,变成了襁褓中的婴儿。以前没经历过白事,都会认为气氛会比较压抑。现在走过一轮才发现,不需要太多伤春悲秋,走了就走了,活的人好好活着,好好吃饭,聚在一起过好日子,纯粹朴实,可能���算是对死者的一种比较好的缅怀方式吧,这么看,法事���在帮死人破地狱,吊唁、奠仪、奠宴等等是在帮活人破地狱,对吗?但活人的破地狱应该会更难些吧。
观察思考:待人纯粹些,做事复杂些
待人纯粹些
- 约会/聚会(对所有亲朋好友)的逻辑应该简化为:喜欢,欣赏这个人身上的某些点->想和他保持关系、维持联系->直接提前联系和预约,商讨时间地点,充分考虑对方并且考虑是否要叫共友。
- 沟通/说服/辩论:观点先行,事实和理论佐证,切勿附带个人情绪,时刻换位思考
做事复杂些
- 能建模的事情就建模,考虑因素尽量多些,能引入数学就更好了,能内化到自己熟悉的领域,锦上添花。
观察思考:沟通/说服/辩论/吵架,是否可以建模?
沟通/说服/辩论/吵架是否=论据(事实)、逻辑、情绪的加权组合呢?
2026-08-23
设计思路:熊窝-照片墙
处理一些照片。感觉“”关系时间线➕家居变动“可以挪过来改造
类型:
- 亲朋好友-聚会、红白事
- 家具家电购置
- 过马路-吵架、约会、旅游
观察思考/设计思路:猫猫-救助其实也可以建模
系统组成
最小系统组成:该区域的
- 人群的数量、分布、知识水平、救助理念
- 餐饮分布及数量
- 区域总可支配收入
- 猫咪数量
- 救助模式
1.人群的数量、分布、知识水平、救助理念
身份A: 放归/弃养者
- 信息量:不了解流浪猫的生育机制及生存风险,认为放归=!=弃养=从一个能温饱的地方转移到了另一个能温饱的地方
- 理念:只要在好点的地方(学校/商圈)放归就能解决猫的温饱
身份B:A 类救助者
- 信息量:了解流浪猫的生育机制及生存风险,认为放归=弃养。
- 理念:任何流入该区域的猫,都应该施以援手
身份C:B 类救助者
- 信息量:了解流浪猫的生育机制及生存风险,认为放归=弃养。
- 理念:只救助该区域的猫
身份D:C 类救助者
- 信息量:了解流浪猫的生育机制及生存风险,认为放归=弃养。
- 理念:
- 人为流入该区域的猫可以给于一定程度上救助(寻主➕定期领养)
- 自然流入该区域的猫应当在考虑猫咪数量动态平衡(简化为”流入=流出“)和区域总可支配收入的前提下救助
2. 餐饮分布及数量
餐饮数量的多少与流浪狗数量的多少正相关
3. 区域总可支配收入
4. 猫咪数量
5. 救助模式
bear目前认为救助模式可以表征为多种行为的可选叠加如:
- 投喂
- 投喂➕绝育
- 投喂➕绝育➕伤病送医
- 投喂➕绝育➕伤病送医➕一针疫苗
- 投喂➕绝育➕伤病送医➕三针疫苗
- 未完待续
系统分型
基本建模完成以后便可以基于模型类型辅助救助决策,bear认为系统应按最决定性因素分为 I 型系统,II 型系统,III 型系统,目前认为可支出经济应当作为系统分类的最大权重因素,在这一维度下,人群具备一定知识水平,高经济收入的区域应被归为I型系统;人群具备一定知识水平,一定经济收入的区域应被归为II 型系统;人群具备一定知识水平,无经济收入的区域应被归为III型系统。
基于该理论推演的决策
- ⚠️Towrite
一些思考和心里话
这里是 bear 经历了一些救助后的思考:
- 理论的推广和传播需要支撑,是否需要成立社团?把该理论转化为一种理念,但是转化成社团的投入产出比还有评估
- bear 认为对猫猫救助的行为建模是一种理想化的,比较脱离现实因素的决策方式,因为人,bear真的很难去预估每个人的心理和想法————我不知道对于咖啡、夏至、奶泡和我们来说,做出安乐决定和先接到那个电话,哪个是更好的选择;我也想问那只还没来得及起名字的小奶猫,它在手术台上看着外面的医生进进出出时,心里在想着什么。我的想法是用一种比较理想化的方式去尽可能地减少决策被感性和人心影响的程度。既然已经对这些行为和状况做好了相对理性的预设,那么它们真正到来和发生的时候,就遵从自己的内心,纯粹地去执行就好了。
2026-08-24~25
设计思路&行动复盘:PPT-大模型能力的拓展
- 阶段一:8.24 9:00-22:00:思路为——不把能力解耦,讲大模型线性发展.
- 阶段二:8.24 22:00-8.25 2:00:思路为——完全借助GPT来找论文和让他定框架和分类学。
- 阶段三:8.25 7:00-15:00 ,思路为——找知乎的实际综述后转换为自己的分类学,接着借助该分类学将能力解耦后分能力线来进行线性叙事。
2026-08-27~29
设计思路&行动复盘:大组会
- 阶段一:8.27 14:00-17:00 :30篇候选CVPR-oral,分割的七篇
- 阶段二:8.27 19-23 点:选中一篇分割论文 ICSID3,将所有图文放进去
- 阶段三:8.28-8.29 :王老师 8.28 10 点说组会暂停,于是休息了两天干其他事情,比如去宝宝家吃饭,打电动,出去看电影龙餐馆等等
- 阶段四:8.30-
2026-08-31
观察思考:小模型是理想,大模型是面包 ❌ 科研是理想,开发是面包 ✅
yjy 师姐上周组会问了个问题说,大模型那么强,小模型我们还有必要研究吗?
-
区别开大模型开发和大模型研究:bear认为现在干大模型的大部分都还是从事的开发,研究的是如何将现有模型嵌入到已有的工作流和系统中,去辅助性的替代原来的组件。
-
大小模型具备互通性及相互借鉴之处:而小模型和大模型绝对不是对立的,应该说开发和科研才是对立的,小模型的思想可以用到大模型中,而大模型的思想同样也可以用到小模型中
-
大小模型应该相辅相成:小模型会在垂类,特定任务上表现好,更可靠,并且更适合边缘和端侧部署;大模型则追求任务的集成性,很难端侧部署,更多的还是云端部署。
-
”小模型是理想,大模型是面包”,所以这句话应该更正为“科研是理想,开发是面包”,现在大模型正在把原来的 ai 中的科研领域合并,我们应该做的是跳出原来已经很深入的垂域,从大局上看,先建立好整个ai的领域地图,找到大模型没有覆盖到,吞并到的区域,找到那些区域的关联和共同特征,再想办法在这些区域中深入自己的课题研究
- 每天喝 2L 水
- 每天启动一件自己不喜欢干的但有 DDL 的事情(比如最近的 PPT 制作)
- 联系三名好友,不管是通过什么方式
- 睡前不看手机
- 23:30 前上床
- 每天进行 10 分钟的冥想练习
- 整理桌面
- 喝牛奶(在仪表盘中找到合适的位置)
| 类型 | 产品形态 | 是否涉及后端/数据 | 2026 的典型样子 | 你知识库里的例子 |
|---|---|---|---|---|
| A. 纯前端/静态型 | 个人博客、文档站、仪表盘、落地页、作品集、内容站 | 无后端,或只用静态数据文件 | Agent 直接生成 HTML/CSS/JS + 静态数据 | cats、home、personal、reanotes、devnotes 本身 |
| B. Web 应用型 | SaaS、管理系统、在线笔记、电商 | 前端 + 后端 API + 数据库 + 权限 | Next.js / NestJS + Agent 生成 | 《传统全栈开发》的主线 |
| C1. AI 应用型 · 产品层 | RAG 知识库、对话助手、Agent 交付物 | 前端 + 后端 + 模型 API + 向量库/检索 | 「AI 全栈开发」路线;把 Agent 做成产品交付 | 《综述:智能体工作》提到但没展开 |
| C2. AI 应用型 · 工程层 | harness 架构、工具调用、记忆、Agent 设计模式 | 工程方法论,构建 C1 的基础设施 | Agent = LLM + 上下文 + 工具;模型外工程能力 | ai-agent-book(#9)、harness 方法论 |
| D. 移动端型 | 独立 App、小程序 | 视情况 | AI 生成 App 门槛骤降(MiniMax Code 潮汐 App) | 暂无对应博客 |
| E. Agentic Knowledge Work 型 | PPT、视频、图表、报告、调研 | 无传统后端 | 产出「文档类成果」而非代码产品 | 如何用Agent做PPT、调研转视频、财报转网页 |
苏格拉底让柏拉图去麦田里摘一株自己认为最大、最饱满的麦穗,但不能走回头路,而且只能摘一次。
柏拉图刚走进麦田,就看到了一颗特别大、特别饱满的麦穗,但他想着前面也许还有更好的,于是没有摘下。继续往前走时,他看到的麦穗又总觉得不如前面那一颗,最后只能空着手回来。
苏格拉底告诉他:“这就是爱情,总在追求完美中错过眼前的美好。”
苏格拉底让柏拉图去树林里砍一棵最粗、最结实的树,用来冬天烤火,但同样不能走回头路,而且只有一次选择的机会。
这一次,柏拉图吸取了摘麦穗的教训,看到一棵还算不错的杉树,尽管它并非最完美,但也能够烤火取暖,于是就把它砍了回来。
苏格拉底告诉他:“这就是婚姻,是权衡之后的选择,是不再执着于极致完美后的妥协。”
苏格拉底让柏拉图去田野里摘一朵最美丽的花,但不能走回头路,而且只能摘一次。
柏拉图穿过田野时看到一朵美丽的花,认为它就是最美丽的,于是摘下了它。后来他又看见很多美丽的花,却仍然觉得自己摘下的这朵才是最美丽的,于是把它带了回来。
苏格拉底告诉他:“这就是幸福,当你不再摇摆不定,而是遵从内心的选择,珍惜当下所拥有的时刻,就是幸福到来的时刻。”
原始语料:读书时候宿舍有个哥们,和女朋友从高一开始谈了五年多,大学异地,刚好学生会里有个女干事看上他了,频频向他示好,小干事长得很漂亮,看着也家境殷实,总之就是条件比哥们女朋友的要好很多。那时候哥们愁得天天在寝室打转,一边也挺喜欢小干事,一边又觉得对女朋友不好,问我们该怎么办,然后我们寝室长说了一句话让我至今印象深刻。
他说:作为你的兄弟,我希望你能过得好,自然希望你能和更优秀的女孩子在一起。但是作为男人,我觉得你应该对女朋友的青春负责,毕竟她并没有做错什么,她也有可能为你拒绝过更好的男生,既然你当初选择了她,就要有所担当。
原始语料:后来我上了社会开始做这行,接触了许多情情爱爱以后。越发认识到,这世上的爱情是分两种的,一种存粹是人性本能带来刺激,比如看到个美女就想去泡,被女神拒绝了心里死不甘心,这和猴子发情没太大区别,只能算是一种低阶的情感。而真正成熟爱,是用时间用经历去沉淀,两个人风风雨雨过后,把对方当作是今生的选择,愿意共同经营,共同承担责任。
所以用前一种本能冲动去颠覆苦心经营起来的厚重爱,是一种非常愚蠢的行为。
原始语料:我在镜像问题中也说过,可以因为现任不好而分手,但尽量不要因为别人更好而分手。 这不是文字游戏,因为两者的心态是完全不同的。前者是避害,是你尽力尝试之后仍发现经营不起这段感情而止损,是对自己负责的表现。但后者存粹是趋利,是被贪婪的本性所支配而丧失责任感,陷入欲望的深渊。 永远有人会更好。 眼下的即是最好的
- 世界本身 = 实体与关系的场(本体层面,实体存在于关系中),实体(entities)则是世界里「存在的」对象——人、物、事件。它是本体论的切分。
- 数据(data) = 对这个世界「场」的记录(投影/快照,不是世界本身),换句话说是实体在某一观测尺度下的「投影」——测量、记录、符号。数据永远不等于实体,只是它的低维快照。
- 知识(knowledge) = 我们为理解和干预世界而建的模型———数据之间的关系结构,能被用来预测和行动的东西。它不是实体的一部分,而是心智(或系统)对实体建模的产物。
- 体验与意识 = 我们在这个世界里的主观感受,比如疼、喜欢、美,这些「第一人称经验」既不是实体也不是数据也不是知识,它站在以上三者的框架之外。
比如闪卡、论文、博客、视频是同一知识的不同展示形态,是对知识的一次重���,每种形态都丢了一些东西、也加了一些东西������它更像一次有损的投影
- 闪卡:拆成 Q&A 原子单元(为间隔重复服务);
- 论文:组织成带证据的论证链(为可信度服务);
- 博客:加进叙事和例子(为理解服务);
- 视频:变成时间线叙述(为注意力服务)。
- 比如Astro 区分 data 和 content,是因为管道对待它们的方式不同,同样的字节,放左边是”被算的数据”,放右边是”被读的文章” - data 目录 → 结构化记录,被查询(schema 校验、集合操作、用于逻辑); - content 目录 → 文档,被渲染(Markdown/MDX 转 HTML、frontmatter 校验、渲染管线)。
第一章第一页|故事起点:放初遇地点或象征性空镜,配日期、地点和一句“我们从这里开始”;版式以大留白和小字信息建立安静的开场。
第一章第二页|各自的生活:左右各放一张相遇前的生活照,分别配一句当时的状态或兴趣;使用对称双栏,表现两条尚未交汇的轨迹。
第一章第三页|第一次见面:以初遇地点照片或当时相关物件为主,可加入地图定位、票据或旧物细节;照片偏小,给旁白留出阅读空间。
第一章第四页|回望起点:放一张后来重访初遇地点的照片,配简短回望文字;让时间线从“那时”过渡到“现在”,用跨页方向感引出下一章。
第二章第一页|开始聊天:用聊天记录截取、早期留言或手机界面细节作素材,配一两句有代表性的对话;采用消息气泡式错落排版,避免整页塞满文字。
第二章第二页|第一次约会:放第一次约会的合照或地点照,补充日期、天气和当时做的事;一张主图搭配窄栏注释,突出事件而非装饰。
第二章第三页|好感累积:组合 3–4 张早期合照、食物或共同去过的地方,配“我记得……”式短句;采用照片墙或不规则拼贴,营造关系逐渐升温的节奏。
第二章第四页|心动瞬间:选一张最能代表当时情绪的照片,配一句只保留情绪的旁白;大图占主要面积,文字压在留白处,作为章节情绪落点。
第三章第一页|确认之前:放关系确定前后的两张照片,标注时间和关键事件;采用左右对照,文字只说明“发生了什么”。
第三章第二页|明确的日期:以确认关系日或第一次正式约会日为核心,搭配票根、礼物、聊天截图等实物素材;日期做成页面视觉锚点,周围保持克制。
第三章第三页|成为“我们”:放一张正式合照和两三张细节照,写一段从“我”变成“我们”的短文字;主图居中,细节图沿边缘排列,形成聚拢感。
第三章第四页|章节定格:用一张最喜欢的纪念日照片或关系初期合照收束,配一句共同确认的话;整页以大图为主,减少说明,让情绪自然停留。
第四章第一页|一起吃饭:放餐桌、外卖、做饭或常去餐馆的照片,配当天的一句对话;采用多张小图加短标签,呈现生活的连续性。
第四章第二页|普通的一天:组合散步、在家、通勤或午后休息的抓拍,文字写具体动作而非总结;使用四宫格或接触印样式,保留不完美的真实感。
第四章第三页|生活细节:选择手、鞋子、宠物、常用物品和家中角落等局部素材,配“这些东西见证了……”式短句;留出较大空白,让小照片像记忆标本。
第四章第四页|留白与相伴:放一张安静的背影或室内环境照,配一段不超过三行的文字;用大面积留白收慢节奏,再进入旅行章节。
第五章第一页|出发:放行李、车站、车票或出发前合照,标注目的地和日期;用路线线条或小地图作页眉,先建立旅程方向。
第五章第二页|旅途主景:选择一张最具代表性的风景或两人合照作为主图,配地点名和一句现场感受;采用整页大图,避免连续堆放景点照。
第五章第三页|途中片段:组合街道、食物、门票、路牌和随手拍,配每张照片一两个词的注释;用票据、地图截图穿插,像旅行中的翻页记录。
第五章第四页|带回来的记忆:放返程照、纪念品或两人的背影,写“这次旅行留下了什么”;版式从拼贴重新收束为单张照片,为下一章留出情绪转折。
第六章第一页|各自面对的事:用工作、学习、异地或忙碌时期的生活照,配简短时间线;两栏排版分别记录当时的处境,不把困难写成流水账。
第六章第二页|陪伴方式:放通话截图、接送、等待、礼物或手写字条等素材,配具体的“你做过什么”;小图与短句交替,突出行动而非口号。
第六章第三页|一起撑过去:选择情绪真实但不必完美的合照,写一段当时最想感谢对方的话;使用较紧凑的图文组合,体现压力中的相互靠近。
第六章第四页|重新呼吸:以一张雨后、窗边、夜路或重新见面的照片收束,配一句“我们还在这里”;减少元素、扩大留白,让章节从困难释放出来。
第七章第一页|现在的合照:放近期最喜欢的一张合照,标注拍摄时间和地点;采用稳定的居中大图,作为全册回到“此刻”的视觉重心。
第七章第二页|各自的样子:分别放两人的肖像或日常状态照,各配一句自我描述;左右双栏保持统一尺寸,既呈现差异又保持整体平衡。
第七章第三页|共同生活:组合家中角落、宠物、常用物件和最近的日常抓拍,配一段总结性文字;用低饱和、统一色调的照片组成连续画面。
第七章第四页|此刻定格:放一张最能代表当前关系的照片,配“我们现在拥有的……”短句;减少装饰并保留页边空白,把回望自然推向未来。
第八章第一页|写给未来的信:使用一张两人背影、远景或象征未来的空镜,配信件开头和写信日期;版式像信纸,文字成为页面主体。
第八章第二页|想去的地方:放旅行目的地、想看的风景或收藏的地图截图,列出两三项共同愿望;采用愿望清单与小图并置,保持轻盈而具体。
第八章第三页|想完成的事:用生活目标、纪念日计划、想养成的习惯等文字,搭配少量象征性照片或手写素材;采用卡片式分区,但每项只保留一句核心表达。
第八章第四页|继续同行:以两人牵手、背影或远处的合照作收束,配一句承诺或祝福;大图靠一侧、另一侧留白,留下“故事还在继续”的开放结尾。
整体模型已经从“单棵知识树”扩展成了“项目管理器”:
工作区
├── 文件夹
│ ├── 项目 A
│ │ └── 根节点
│ │ ├── 子节点:纵向深入
│ │ ├── 横向节点:同级展开
│ │ └── 旁支节点:相关但不进入主树
│ └── 项目 B
└── 常驻对话
也就是说:
- 一棵树对应一个项目;
- 每个项目从一个根节点开始;
- 节点可以不断向下、横向或旁支扩展;
- 左侧边栏负责文件夹、项目、文档上传和项目导入;
- “常驻对话”是独立于具体项目的全局聊天;
- 本机项目和云端项目可以分开管理。
所以它本质上是:
以项目为单位管理的、可分叉的多轮 AI 对话图谱。
左侧“新建项目”后,系统应该先创建一个根节点;之后用户主要通过划词、预览、实体化来让这棵树逐渐生长。
目前只剩一个结构上的小问题以后再确认:一个项目是否严格只有一个根节点,还是允许项目里存在多个独立根节点。除此之外,整体产品形态已经非常清楚了。
结论先说:**不用从 0 到 1 写,但目前也没有一个仓库能完整覆盖你的需求。**最合适的方式是“找一个底座,再补你独有的交互”。
我按 2026-08-10 的 GitHub 检索结果看了 8 组关键词,共召回 20 条、去重 18 个,重点深读了这些:
| 项目 | 更适合复用什么 | 与你的需求的匹配度 |
|---|---|---|
| tldraw/branching-chat-template | 无限画布、对话节点、节点连线、分支上下文、流式 AI | 最接近你的画布交互,但只有基础模板 |
| stello-agent/stello | Session 树、子会话、分支、跨分支引用、记忆和上下文隔离 | 最接近你的“对话图谱”内核,但没有完整前端 |
| metaspartan/curiso | 无限画布、多 Board、节点聊天、DeepSeek、多模型、RAG、本地存储 | 最接近一个完整产品,但偏桌面端 |
| rpggio/obsidian-chat-stream | 选中节点 → 使用当前节点和祖先上下文 → 生成新节点 | 最接近你的“划词/选取后创建新卡片”逻辑 |
| queelius/ctk | 对话树的数据结构、fork、branch、graft、导入导出 | 很适合参考数据模型,但它是 Python TUI |
| Sayhi-bzb/Agent-HTML | Canvas、可编辑预览、局部上下文和块级交互 | 适合参考“预览卡片”,但不是对话树 |
其中最关键的是前两个。
tldraw/branching-chat-template 已经实现了“在无限画布上放置对话节点、连接节点、根据连接历史生成回答、流式返回”的基本骨架。README 中明确把它定位为 visual chat trees。
但它还没有:
- 划词后生成临时预览;
- 新建 / 分支 / 发散三种语义关系;
- 项目、文件夹、文档管理;
- 每个节点独立的底部聊天框;
- 预览实体化流程。
另外要特别注意:模板自己的代码是 MIT,但它依赖的 tldraw SDK 当前有单独的生产授权限制,公开生产环境需要确认 License Key 或商业许可。tldraw License
stello 更像是你产品的“对话拓扑引擎”。它把每个方向建模成独立 Session,支持 root、child、fork、refs、memory、insight,并且提供 REST/WebSocket 和 PostgreSQL 服务端封装。Stello README
它和你的想法很接近,但它默认是:
Session 树 / Session 森林
而不是:
项目
└── 根卡片
├── 子卡片
├── 同级卡片
└── 发散卡片
所以你仍然需要在应用层增加项目、卡片、预览和三种关系。
我的建议是:
- 验证交互原型:参考或临时 fork
tldraw/branching-chat-template。 - 设计正式数据模型:参考
stello的 Session/Topology 思路。 - 实现选取生成节点:参考
obsidian-chat-stream。 - 项目、Board、DeepSeek 配置:参考
curiso。 - 如果要公开部署:不要直接把 tldraw SDK 当最终底座,先确认授权,或者采用 React + 其他画布库自行实现节点层。
所以你真正需要从头写的,不是整个系统,而是这些“你的产品独有部分”:
划词
→ 生成预览
→ 选择新建 / 分支 / 发散
→ 实体化节点
→ 节点内多轮对话
→ 项目和文件夹管理
换句话说,建议路线不是“从 0 写一个 AI 聊天应用”,而是:
复用画布、流式聊天、对话树和存储基础设施,再自己实现你的预览与分叉语义。
另外,LangChain Open Canvas 虽然很成熟,但已经归档,而���������更��文档/代码 Artifact 编辑,不适合作为你的对话图谱底座。
在这个断言下个人认为适用的场景有:
-
同物种非对称关系
- 年龄代沟
- 父母子女(尤其是人生转折时期的沟通,如叛逆期,升学期,择业期,结婚生子买房期),最具体的例子比如初高中生包括我自己与家长的沟通问题,家长不知道学生在想什么,学生也不会有家长的视野和信息量
- 长辈晚辈(特别是阿尔茨海默患者,晚辈不知道长辈的思路,长辈也会比较执着的坚守自己的三观,很难通过一种比较体面或者说不损失长辈自尊的前提下去让他们改变一些观念)
- 师生关系 此处说的师生指代的是存在领域知识差异,并且双方具备一定学习和传授意愿的主体,而不是学校里传统意义的师生。我认为教学就是老师在通过传递信息的方式去帮助学生填补某个领域的空白,而学生也会通过一定媒介(如作业、试题、面授等形式)去向老师传递信息,给于老师反馈,进而让老师去发现学生更具体的领域空白,帮助老师训找信息失真度更低的方式去授课(如修改 PPT,修改作业思路等)
- 年龄代沟
-
同物种对称关系
- 情侣关系 不再赘述,只是从个人经历出发认为情侣是最需要信息对称以后再沟通的一种关系,吵架的时候先交换信息,明白对方的心路历程和核心诉求,那么接下来的沟通就会极大地事半功倍
-
不同物种关系
- 人宠关系 如果我能知道大头怎么想,大头也能知道我怎么想就好了
已经积累、可用于支撑未来生活的现金、投资和其他资产。
从全职工作逐步过渡到低强度工作或非工作状态。
对自己正在做的事情感到有意义、有贡献或值得投入。
与家人、朋友、同事或社区保持真实而持续的联系。
在没有固定组织监督的情况下,主动安排时间、任务和收入节奏。
一个人日常活动、办事、就医和社交通常覆盖的范围。
保留部分工作或项目,同时减少工作时间和强度的生活方式。
- 定义:在信息过剩的环境中,人的注意力成为稀缺资源,平台和创作者都在竞争点击、停留、完播、评论和转发。愤怒、焦虑、冲突、猎奇等情绪,通常比平静的事实和严密的论证更容易抓住注意力。
- 影响:这并不意味着所有视频都低质,但它会形成一种激励偏差:先用情绪吸引人,再用观点解释;有时甚至让情绪直接替代事实和逻辑。
- 关于情绪为什么更容易带来点击,有一项发表在《Nature Human Behaviour》的研究分析了约10.5万种新闻标题、3.7亿次曝光和570万次点击。结果显示,在平均长度的标题中,每增加一个负面词,点击率平均提高约2.3%。这不是说所有负面内容都有效,但说明负面措辞确实可能带来点击优势。
- 关于互动,一项对101292条TikTok新闻视频的研究发现,负面情绪与更高的点赞、评论和分享比例相关;另一项PNAS研究分析了563312条推文,发现道德化、情绪化语言更容易在社交网络中扩散。
在人类出现推荐算法之前,就已经偏好新奇、冲突、八卦和低认知成本的信息。
平台只是把这些倾向量化成点击率、停留时长、完播率和互动率,再通过算法不断推送最容易引发反应的内容。用户刷得越多,就越习惯快速获得刺激和结论
- 定义:注意力经济的放大器。它通常根据停留时长、完播率、点赞、评论、转发以及用户过去的观看习惯,判断什么内容值得继续推荐。
- 影响:它不会真正判断内容是否真实、严谨或有逻辑。因此会形成一个循环:情绪强烈的标题更容易引发点击和争论,算法发现互动率高,就扩大推荐;创作者看到这种内容有效,也会进一步模仿。久而久之,男女关系、父母子女关系等复杂问题,容易被包装成简单的对立和冲突。 所以,问题不只是“算法让人变得情绪化”,而是平台目标、创作者激励和用户偏好共同把情绪内容筛选了出来。推荐量高,只能说明它抓住了注意力,不能证明它有事实依据。
- 为何迎合:出于自身目的和利益
- 特点:
- 情绪强烈、冲突明显、结论简单的内容
- 用个案代替整体、用感受代替事实、用标签代替分析,追求煽动情绪和制造对立
- 缺少背景、数据和反例,把复杂问题简化成非黑即白的道德对立。如一个人没有及时回复消息=“不爱你”;一次家庭冲突,就被总结为“父母都在控制孩子”。
- 常见形式:
- 先用愤怒、委屈、恐惧或煽情故事吸引观众,再围绕男女关系、父母子女关系、婆媳、职场等话题迅速给出判断。
- 接收到的是
- 碎片化信息
- 算法、创作者出于自己的目的和利益给他们投影的世界
- 后果:
- 用户被视频带来的情绪和碎片观点占据大脑和时间,
- 无暇思考,无暇使用自己的大脑,大脑动不起来。
- 越来越麻木,喜欢情绪化的,即时的满足
- 黄赌毒
- 电子游戏
- 短视频
- 研究
- 毕业季的学生弃养/放归
- 住在附近小区社区,并且在学校工作的工作人员弃养/放归
- 出生的小猫
- 家属区,教学区外自行跑来的猫猫
原神思路
- 讲从大模型能力上的扩展,比如理解能力到生成能力,生成能力到推理能力
- 然后可以讲述这些大语言模型能力提升的历程(Deepseek、Qwen、GPT)这些
- 再到多模态大模型的出现和能力扩展(包含视频生成模型、具身智能模型、世界模型的发展)
我自己思路
- 大模型能力拓展的历程/实现手段简述➕四个具体案例(gpt,llama,deepseek,glm),包含理解-生成-推理-多模态
- 目前的前沿方向枚举:世界模型、具身智能(VLA)-能力层,下游任务及探索举四个案例(落到具体应用场景和公司,但是着重说探索,而不是说应用,避免和第五部分撞)
- 形式:可以顶部文字不变,然后下方图片改变的那种叙事方式
留痕:想完全放弃主动思考,让 GPT 老师给我们定好每一页的框架(绝对错误的做法❌)
第一层是确定主论点,也就是“大模型能力拓展”究竟想说明什么。
第二层是确定内容顺序,包括规模化预训练、后训练、推理、多模态、外部工具、世界模型和 VLA 之间的关系。
第三层是为每个观点寻找论文、实验或模型案例。
第四层才是统一页面结构、图表形式和视觉风格。
在讨论内容的时候,可以提前记录每页的四个东西:这一页要回答的问题、最重要的一句话、支撑它的材料、适合用什么视觉形式表达。比如第三页可以写成:==规模化预训练==如何拓展模型的通用能力?”核心材料是 GPT-3 和 Chinchilla,视觉上适合用规模变化或能力变化示意图。这样既不会过早陷入排版,也不会到了最后才发现某一页没有合适的内容。
因此目前不需要马上制作完整 PPT。我们应该先把“内容脚本”讨论出来,最终形成类似这样的结构:
页码|这一页的问题|核心结论|论文或案例|页面形式|与下一页的衔接
想让GPT去帮我定好分类学,也是 很错误的一个做法
对,前面确实混入了三种不同东西:能力类型、技术手段和系统形态。先把它们分开。
下面这张表是一张“能力观察地图”,不是某一篇论文规定的标准分类。它的特点是:各维度可以同时存在、相互组合,不是互斥的阶段。例如,一个模型可以同时具备视觉理解、复杂推理和工具调用能力。
| 能力维度 | 核心问题 | 能力拓展表现 | 典型技术或研究对象 |
|---|---|---|---|
| 感知与输入 | 模型能接收什么信息? | 文本 → 图像、音频、视频、3D、传感器数据 | 多模态预训练、视觉语言模型;[Flamingo](https://arxiv.org/abs/2204.14198) |
| 理解与表征 | 模型能建立什么样的内部表示? | 从词语关系 → 语义、空间、时间、对象关系和环境状态 | Transformer、跨模态对齐、基础模型;[Foundation Models](https://arxiv.org/abs/2108.07258) |
| 推理与计算 | 模型能处理多复杂的思维过程? | 直接回答 → 多步推理、规划、搜索、验证 | Few-shot、思维链、强化学习、测试时计算;[GPT-3](https://arxiv.org/abs/2005.14165)、[Chain-of-Thought](https://arxiv.org/abs/2201.11903) |
| 生成与表达 | 模型能输出什么结果? | 文本 → 代码、图像、音频、视频、3D 内容和结构化方案 | 自回归生成、扩散模型、多模态生成 |
| 知识、记忆与 grounding | 模型的信息从哪里来,能否保持和更新? | 参数内知识 → 长上下文、检索知识、外部数据库、持续记忆 | RAG、长上下文、记忆模块、知识库和工具调用 |
| 行动与环境交互 | 模型能否影响外部世界并根据反馈修正? | 输出答案 → 调用工具 → 操作数字环境 → 控制物理设备 | ReAct、Agent、世界模型、VLA;[ReAct](https://arxiv.org/abs/2210.03629)、[World Models](https://arxiv.org/abs/1803.10122)、[PaLM-E](https://arxiv.org/abs/2303.03378) |
留痕:逐页自己想的一些尝试记录
P1:大模型能力拓展有哪些维度
- 多模态能力:
- 模型的接收信息:文本 → 图像、音频、视频、3D、传感器数据
- 模型的输出结果:文本 → 代码、图像、音频、视频、3D 内容和结构化方案
- 工具调用能力:
- 理解和推理能力:
- RLHF让模型能够学会理解指令-gpt3.5
- 记忆能力:
留痕:最后看了别人的实际帖子后的一些启发
让模型能从预测任务变为自然语言上的通用任务-gpt 3
让模型能理解指令-gpt 3.5
让模型能在推理时减少内存需求-moe
让模型能推理时计算-gpt o1
让模型接外部知识库-RAG————能查资料
让模型会调用工具————能办事
让模型能处理更多模态信息-多模态大模型
让模型能使用电脑-computer use
- 30 篇 Oral:分割 7 篇、检测/OOD/长尾 4 篇、对应/跟踪/光流等 10 篇、专项识别/人体运动等 9 篇。(GitHub)有个很值得注意的点:这 30 篇里,传统意义上的 object detection(YOLO/DETR 那种普通检测)其实极少。真正大量出现的是 开放世界/OOD、in-context segmentation、semantic correspondence、tracking、3D/human understanding。这其实非常能反映 CVPR 2026 传统 detection/segmentation 方向正在往哪里迁移
| # | CVPR ID | 论文 | 子领域 | 第一作者 |
|---|---|---|---|---|
| 1 | 40263 | INSID3: Training-Free In-Context Segmentation with DINOv3 | In-Context Segmentation | Claudia Cuttano |
| 2 | 40267 | S²AM3D: Scale-controllable Part Segmentation of 3D Point Clouds | 3D Point Cloud Segmentation | Han Su |
| 3 | 40296 | VGGT-Segmentor: Geometry-Enhanced Cross-View Segmentation | Cross-View Segmentation | Yulu Gao |
| 4 | 40297 | RobotSeg: A Model and Dataset for Segmenting Robots in Image and Video | Image / Video Segmentation | Haiyang Mei |
| 5 | 40321 | PR-MaGIC: Prompt Refinement Via Mask Decoder Gradient Flow For In-Context Segmentation | In-Context Segmentation | Minjae Lee |
| 6 | 40362 | CoSMo3D: Open-World Promptable 3D Semantic Segmentation through LLM-Guided Canonical Spatial Modeling | Open-World 3D Segmentation | Li Jin |
| 7 | 40374 | Differentiable Laplacian Matrix Guided Superpixel Segmentation | Superpixel Segmentation | Jeremy Juybari |
| 8 | 40266 | Learning Latent Concepts for Detecting Out-of-Distribution Objects | OOD Detection | Ting Peng |
| 9 | 40292 | ANTS: Adaptive Negative Textual Space Shaping for OOD Detection via Test-Time MLLM Understanding and Reasoning | OOD Detection / MLLM | Wenjie Zhu |
| 10 | 40316 | Learning Like Humans: Analogical Concept Learning for Generalized Category Discovery | Category Discovery | Jizhou Han |
| 11 | 40340 | Confusion-Aware Spectral Regularizer for Long-Tailed Recognition | Long-Tailed Recognition | Ziquan Zhu |
| 12 | 40275 | From Pairs to Sequences: Track-Aware Policy Gradients for Keypoint Detection | Keypoint Detection / Tracking | Yepeng Liu |
| 13 | 40295 | Customized Fusion: A Closed-Loop Dynamic Network for Adaptive Multi-Task-Aware Infrared-Visible Image Fusion | Infrared–Visible Fusion | Zengyi Yang |
| 14 | 40305 | MARCO: Navigating the Unseen Space of Semantic Correspondence | Semantic Correspondence | Claudia Cuttano |
| 15 | 40322 | The SA-FARI Dataset: Segment Anything in Footage of Animals for Recognition and Identification | Animal Recognition / Segmentation | Dante Wasmuht |
| 16 | 40348 | Optical Flow Matching: Reframing Optical Flow as Continuous Transport Dynamics | Optical Flow | Ao Luo |
| 17 | 40366 | Featurising Pixels from Dynamic 3D Scenes with Linear In-Context Learners | Representation / Dynamic 3D | Nikita Araslanov |
| 18 | 40367 | Streaming Diffusion Model for Fast Infrared and Visible Video Fusion | Video Fusion / Diffusion | Jinyuan Liu |
| 19 | 40392 | SEATrack: Simple, Efficient, and Adaptive Multimodal Tracker | Multimodal Tracking | Junbin Su |
| 20 | 40394 | SDTrack: A Baseline for Event-based Tracking via Spiking Neural Networks | Event-Based Tracking / SNN | Yimeng Shan |
| 21 | 40396 | U²Flow: Uncertainty-Aware Unsupervised Optical Flow Estimation | Optical Flow | Xunpei Sun |
| 22 | 40280 | ImmerIris: A Large-Scale Dataset and Benchmark for Off-Axis and Unconstrained Iris Recognition in Immersive Applications | Iris Recognition | Yuxi Mi |
| 23 | 40311 | SAM 3D Body: Robust Full-Body Human Mesh Recovery | Human Mesh Recovery | Xitong Yang |
| 24 | 40331 | Plant Taxonomy Meets Plant Counting: A Fine-Grained, Taxonomic Dataset for Counting Hundreds of Plant Species | Fine-Grained Recognition / Counting | Jinyu Xu |
| 25 | 40349 | Fine-grained Image Aesthetic Assessment: Learning Discriminative Scores from Relative Ranks | Aesthetic Recognition | Zhichao Yang |
| 26 | 40350 | MAMMA: Markerless Accurate Multi-person Motion Acquisition | Human Motion Capture | Hanz Cuevas Velasquez |
| 27 | 40351 | Natural Human Motion Recovery by Aligning High-Order Temporal Dynamics from Monocular Videos | Human Motion Recovery | Dingkun Wei |
| 28 | 40354 | SoccerMaster: A Vision Foundation Model for Soccer Understanding | Video Recognition / Sports | Haolin Yang |
| 29 | 40375 | BoostSLT: Boosting Sign Language Translation via a Plug-and-Play Diffusion-Based Semantic Enhancer | Sign Language Recognition / Translation | Changzhou Han |
| 30 | 40388 | OpenDance: Multimodal Controllable 3D Dance Generation with Large-scale Internet Data | Human Motion / Dance Generation | Jinlu Zhang |
| 综合排名 | 论文 | GitHub Stars | 开源状态 | 综合判断 |
|---|---|---|---|---|
| 1 | INSID3 | 733 ⭐ / 67 forks ([GitHub][1]) | 很完整,代码 + Demo | 强烈关注 |
| 2 | S²AM3D | 205 ⭐ ([GitHub][2]) | 模型+数据已放,训练代码仍有 TODO | 强烈关注 |
| 3 | CoSMo3D | 91 ⭐ / 6 forks ([GitHub][3]) | train/eval/模型都有 | 重点关注 |
| 4 | RobotSeg | 117 ⭐ / 8 forks ([GitHub][4]) | 七篇里工程开放最完整之一 | 重点关注 |
| 5 | PR-MaGIC | 8 ⭐ ([GitHub][5]) | 代码已公开,可复现 | 方法值得读 |
| 6 | VGGT-Segmentor | 22 ⭐ ([GitHub][6]) | Code + checkpoint | 方向性关注 |
| 7 | Differentiable Laplacian Superpixel | 1 ⭐ ([GitHub][7]) | 代码、数据、权重较完整 | 专项研究再看 |