All posts

17 threads

simonwillison.net

>对于 Fable 5,甚至 Opus 4.8 这样的模型,在系统提示词中添加示例已不再是最佳实践。Claude Code 的系统提示词最近缩减了 80%。
>同样,“不要做 X,也不要做 Y”这类列表可能会降低最新模型输出结果的质量。

所以 harness 需要针对不同的模型设置不同要求的提示词,目前 Claude Code 是这么做的。这一点应该对所有前沿模型都适用hh 这就是非 OpenAI 和 A\ 公司做 harness 的劣势,只有等到基础能力模型的能力相对稳定后才能慢慢跟上这两家的能力。



ppwwyyxx.com

"Real tasks" 又有多少轮得到 academia 做贡献: academia 看得到 bitter lesson, 却没有先进的认知去理解如何做 scaling, 判断什么方法是 scalable 的, 更遑论有足够的人才和算力去做真正的 scaling. 试图提出 "新范式", "统一架构" 的工作, 不少无非是对 bitter lesson 的拙劣解读, 在并不重要的问题下扑棱一下翅膀. 在今天 frontier labs 的 scale 下, academia 已经基本失去了在 real tasks 上 "评价一个方法是否有效" 的话语权.


历史经验告诉我们, 本质的改进无一不是基于对 "为什么" 的深刻理解, 只追求 "效果好" 的盲目优化会得到复杂, 不泛化, 无法经受时间检验的方法. 整个领域在 Neural Architecture Search 这个方向上浪费的时间就是最直接的例子.


Devil's in the details: 我第一次震惊于 details 的重要性, 是恺明向我展示 ResNet 的 loss curve 要怎么 smoothing. 在合理的 median-smoothing 下, 我们能看到以 epoch 为周期的 overfitting 现象, 在多年后被其他人称为 epochal sawtooth phenomenon: 每个 epoch 的 train loss 会缓慢上升, 再在下一个 epoch 开头骤然下降.

CVPR2017, 在夏威夷海边的晚宴上, 孙剑关于 research taste 给过这样一个建议: 遇到一个新问题 / 新方法, 你要去想, "如果我是恺明, 我会不会对这个问题 / 方法感兴趣?"


在 agent 能做的事情越来越多的今天, 作为指挥者的人需要亲自做的事情越来越少, 人的 taste 也越来越重要. Taste 是关于 "我要实现什么价值" 的 vision, 是关于 "我想要做什么" 的 motivation, 是关于 "做成什么样是好的" 的 judgement, 是关于 "为什么可以这样做" 的 curiosity.






jt26wzz.com

Quote:但是一个长久运行的开源社区强调的是代码的可维护性,能够让许多维护者顺利完成接力跑。当然有人会说 LLM 自己写代码,LLM 自己维护自己修,嗯,我觉得这个观点我不想去辩驳。但我觉得,一个长期维护的项目这么搞,以 LLM 存在的随机性和上下文限制,没有一些拥有工程品味和真正长期记忆的维护者,最后的结局肯定是:迭代变得越来越困难,修一个 Bug 牵一发动全身,维护不下去之后然后开始漫漫重写/重构之路。


docker compose 中写连续端口映射会导致内存爆炸,神奇



lucumr.pocoo.org

请记住,人工智能并没有增加需要软件的人数,也没有增加能够审查软件的维护人员数量。它主要增加了代码量和竞争关注的项目数量。其中一些是健康的,但很多却分散了本应共享的努力。


今天上午的洗牙也太快了,从坐下到结束应该都没有10分钟,虽然去年的痛苦经历还历历在目,但是今年这次是不是有点过于敷衍了,最后都没有给抛光,还夸了口腔卫生不错(去年让我做龈下刮治orz)


阿里云轻量服务器(峰值200M)由于接了 IXP 服务,被官方关停了。(猜测,毕竟也只跑了这个转发服务)。

您的轻量应用服务器实例XXX由于发布、传播违法不良信息,严重违反了《阿里云服务条款》及《互联网信息服务管理办法》第十五条规定,阿里云已将该实例关停锁定,详细说明如下:

违规URL示例:IP

违规原因:发布传播违禁器具软件类违法违规内容


最近几周云顶导致睡的太晚,某天早上醒来喉咙疼痛才意识到免疫系统抗议,这两天早睡,感觉状态好多了。