读物 · Reading · AI 与大模型
大模型原理、模型盘点、AI 工具实测——尽量讲到初中生也能懂。
一句话:这两个东西都不是 AI,是造 AI 的机床——本质是两台「自动求导机」。它们当年吵得最凶的那个分歧(先画图纸还是边搭边跑)今天已经不存在了,因为两边都偷偷学了对方:TensorFlow 2.0 改成了默认动态,PyTorch 2.0 学会了编译。本文用四组当场跑出来的实验拆开这件事,其中三组推翻了作者自己的预期——包括「TensorFlow 报错难懂」(实测它比 PyTorch 更短更清楚)。顺带用官方接口的硬数据破除三个流传很广的说法,并解释为什么 TensorFlow 的收藏数是 PyTorch 的 1.93 倍、下载量却只有它的五分之一。
阅读全文 →一句话:我把新加坡政府招聘站上全部 892 个 AI 岗位爬了下来,又用真实浏览器破了 JobStreet 的反爬做交叉验证。结论是——590 份含 AI 内容的职位描述里,401 份(68%)一个高阶可靠性概念都没提,而「幂等」这个决定 AI 能不能真上生产的词,全场只出现 3 次。提到工具调用、MCP、人工监督、审计链的岗位,薪资中位从 S$10,000 跳到 S$12,000 以上。文章把最难的两条黑话拆到能落地:什么是幂等(含五种实现手段、三个必测场景、一条会计红线),以及为什么劳斯莱斯明确要求「代理代码里不许写 if-else」——这个要求听着像玄学,其实是一套很硬的架构纪律。
阅读全文 →一句话:Claude Opus 5、GPT-5.6、Gemini 3、Kimi K3、DeepSeek V4——一次讲清各家现在有什么、强在哪。分数取自独立评测机构而非厂商自报,中国模型的开放权重情况直接查 Hugging Face 官方账号实况(顺手纠正了网上流传的两个错数字)。但比「谁第一」重要得多的是另一个分岔口:你是在租一个模型,还是能把它拿走。
阅读全文 →一句话:它不是在撒谎——撒谎需要知道真相,而它两样都没有。真正的原因藏在一个你天天经历的地方:考试的计分规则。答对给分、说不知道不给分,那么「不会也要蒙一个」就是最优策略——AI 面对的正是这套规则。本文从我自己写上一篇文章时编造三个数字的翻车现场讲起,拆开 OpenAI 2025 年论文给出的两层原因,并给出你今天就能用的三招。
阅读全文 →一句话:AI 读句子时看到的不是字母,是被切好的「文字积木」——这解释了它很多低级错误,但「全都怪切词」这个流行说法其实站不住。本文用能自己跑一遍的实验,看「草莓」怎么被旧分词器切成 5 块连屏幕都显示不出来的碎片、中文调 API 为什么可能贵 2.6 倍,再用 11 个模型的公开实测数据,带你完整走一遍「怎么检验一个听起来很有道理的说法」。
阅读全文 →一句话:训练结束后模型的脑子就冻住了——你说什么都改变不了它。所谓「它记得我」,是四套完全不同的机制在起作用:上下文是摊开的书桌(关掉就清空)、KV 缓存是用完即扔的草稿纸(只管快不管记)、RAG 是临时跑一趟图书馆(可能找错书)、长期记忆是存在模型外面的档案袋(删了就真失忆)。搞混这四样,你会一会儿高估它、一会儿低估它。
阅读全文 →一句话:很多科普说「Transformer 就是注意力」——这是错的。因为注意力本身完全不知道词的先后顺序,只有它的话,模型连「今天我请你」和「今天你请我」都分不出来。本文把整条流水线拆开:位置编码、注意力、前馈网络(参数量其实比注意力还大)、残差、归一化,少一个都跑不起来。
阅读全文 →一句话:AI 画图的思路反直觉得可爱——先学会怎么把一张好图弄脏,然后反过来做。训练时把清晰照片一步步加噪声直到变成雪花屏,生成时从随机雪花屏出发、按你的文字一步步擦干净。模型里没有存任何一张原图,所以同一句提示词每次给你的都是全新的图。顺带破除三个流传很广的误解。
阅读全文 →一句话:注意力机制做的事情简单到你每天都在做——面对一大堆信息,先扫一眼各自是讲什么的,再决定重点看哪几条。本文用班级群把 Query/Key/Value 三个零件讲完,再说一件很多科普会讲错的事:注意力热力图看起来像解释,但「它算不算解释」学界至今还在吵,正反双方三篇论文标题一个比一个直接。
阅读全文 →一句话:各家都在比谁的上下文窗口更大,但「装得下」和「读得准」完全是两回事——一项覆盖 18 个主流模型的实测发现,性能下降远在触及窗口上限之前就开始了。还有一条连研究者都觉得意外:把连贯的长文章打乱顺序之后,模型表现反而更好。本文给出五条你今天就能用的对策。
阅读全文 →一句话:2026 年 6 月 12 日下午 5 点 21 分,一纸出口管制令要求某 AI 公司停止向所有外国国民提供两个模型;由于无法实时核验用户国籍,公司只能对全球所有用户一起关停,18 天后才恢复。导火索是一份关于「越狱」手法的报告——模型被诱导读一段代码并产出了演示该漏洞可利用性的代码。
阅读全文 →一句话:让 AI 先写解题步骤再报答案,正确率确实会大幅提高——因为模型是一个词一个词往外写的,允许它多写就等于给它多算的机会。但有两个坑:想得越久不是无限有效(收益曲线有拐点,过了之后只涨钱不涨分),以及最要紧的——它写出来的思考过程是写给你看的说明,不是它内部运算的录像。
阅读全文 →一句话:让 AI 替你养一个会自我维护、越用越聪明的知识库。本文逐字核对 Karpathy 本人 gist 后还原真相——三层架构、三个操作、为什么 AI 适合干维护;并对「9 条军规 / 比 RAG 快 70 倍 / 10 万 token / 第二大脑」等自媒体加工逐条打假。
阅读全文 →一句话:这些证书全不是学历,含金量差十倍,分界线只有一条——要不要监考考试。从一张「Anthropic 官方认证专家」海报说起,把 Google / 微软 / AWS / 英伟达 / OpenAI 等十几家公司的 40+ 张 AI 证书全列一遍:叫啥、多少钱、什么难度、要不要考试,并教你一眼识破注水头衔。
阅读全文 →朋友转你一个"AI 自动炒股、几万人收藏"的链接,该信吗?这篇把 TradingAgents、ai-hedge-fund 这些 6 万到近 9 万 star 的开源项目用大白话讲清:它们的逻辑就是"让一群 AI 分别扮演分析师和巴菲特、芒格等投资大师开会吵架",听着唬人,其实作者自己都在最显眼处写着"仅供学习、别拿真钱"。为什么?2025—2026 一批严谨研究反复证明,它们漂亮的"历史战绩"绝大多数是利润幻觉——AI 不是在预测,而是在"背答案"(读过了后来发生的事),一旦过了它的学习截止日,超额收益立刻蒸发。还拆了"漂亮回测"为什么几乎都不能信的四个陷阱(背答案/只挑赢家/不算成本/换个行情就失灵),以及一个朴素到无法反驳的常识:真能稳拿 5% 我早去当基金经理了,凭什么免费送你。最后给出 AI 在炒股里真正该干的三件事:更深更全的分析、更及时的提醒、对可能波动的风险预警——它是好用的研究助手,不是稳赚的承诺。附一页"看到 AI 荐股该怎么想"防坑清单。
阅读全文 →2026 年中实测:一张 RTX 5090(32GB)本地出图已接近专业水准(写实找 Flux、画风化角色找 SDXL/Illustrious,1-3 秒一张);但本地视频的现实天花板是 720p、5 秒、一条渲染 2-9 分钟(LTX-2 最快 22 秒、Wan 2.2 14B 最稳 2 分钟),最强的 4K 带音长镜头仍只在云端(Seedance/Veo/Kling/Sora)。外加一篇亲手踩完的「Wan 训练格式地狱」复盘:双专家结构把一切翻倍、fp8_scaled 不可训、fp16 爆显存、精度互相打架、block-swap 慢 5 倍——为什么我最后改用 SDXL 训角色 LoRA。各模型显存/速度/时长附实测数字与出处。
阅读全文 →Anthropic 本想从 2026-06-15 起给订阅单独一份每月 $20/$100/$200 的「Agent 额度」,但这套改动在生效当天被官方暂停——目前这些用量仍并入订阅正常 limit,没有会过期的独立额度(已据官方支持页核实纠正)。所以这篇的重点是另一面:你的订阅到底能跑哪些第三方 agent 工具、不同的人分别该用哪个。盘点 24 个真实项目(OpenClaw、Conductor、Cline、Zed、Claude Squad、Claude Flow、Happy、Omnara、NanoClaw、Meridian…),分七类、标清热度/订阅认证/坑;再按 14 类人群给"首选+为什么+上手难度+诚实提醒"——包括好几类人「最好别折腾、直接 claude.ai」。一条铁律贯穿全文:认证决定计费,残留一个 ANTHROPIC_API_KEY 就会让你以为在用订阅、其实在烧 API。两轮共 10 个 agent 实搜 + 逐个核实,0 幻觉项目。
阅读全文 →14 个 AI 分身各 clone 一个仓库精读,按「结果/效率/成本」三轴横向对比 15 家作者/合集(花叔、归藏、乔木、Trail of Bits、Asgard、caveman、humanizer、book-to-skill、dev-browser、两大巨型合集…)。核心分水岭:带能跑脚本/接真实数据的才值得装,纯提示词天花板就是 Claude 本身、挖方法即可。含 6 组同赛道 head-to-head 对比(去AI味/安全审计/大合集/导航/内容创作/省token)+ 行动清单 + 成本陷阱 + 2 张示意图。
阅读全文 →把仓库整个拉下来,21 个 AI 分身各翻一份 Skill 源码按实用度打分:作者花叔确有技术,但整包装会把写死的私人路径、缺失的脚本和作者广告一起搬进你的机器——21 份裁决里一个「直接装用」都没有。点名 5 个通病(私有路径写死 / 核心脚本没随附 / 个人品牌广告 footer / html2pptx 其实是官方引擎改写 / 一半是几十行可自写的纯提示词),并给出真正值得挖的领域知识清单。含 1 张示意图。
阅读全文 →从把 PDF 变笔记、用自家显卡出图,到一键发文章、让机器人替你回消息——把一套真实的 Claude 技能收藏按用途分成六大类逐一讲清,术语全翻成大白话,配 4 张原理示意图(连这篇文章本身,都是某个技能发布的)。
阅读全文 →昨天刚发布的 Claude Fable 5 强在哪、GPT-5.5 / Gemini 3.5 各家在拼什么、中国开源模型把跑分卷到哪了、Hugging Face 趋势榜在火什么、你家显卡能跑多大的模型——术语全翻成大白话,事实逐条标来源,传闻明确标注。
阅读全文 →2026 最强 AI 音乐工具全调查:Suno / Udio 谁更强、怎么精细编曲、怎么和真人合唱、各家价格、能不能让 Claude 自动作曲——写给完全不懂音乐的人,术语都翻译成大白话。
阅读全文 →