Hermes 的秘密:不同 AI 模型需要不同指令|原始碼解析 + 三篇論文驗證

00:00 各位观众大家好,我是小金 00:02 今天带大家看一个开源框架Hermes的设计 00:06 它做了一件很聪明的事 00:08 针对不同的RI模型给不同的系统指令 00:12 为什么要这样做? 00:14 因为研究现实,同样的工具只改一个设定 00:19 效能可以拆10倍 00:20 开源框架Hermes的做法更进一步 00:23 它在原始码里有一行Python程式码 00:27 列出需要额外指令的模型 00:30 GPT, Codex, Gemini, Gemma, Groker 00:34 注意, Claude 不在这个清单里 00:37 Hermes 的开发者认为 00:38 Claude 天生就会主动用工具 00:41 不需要强制 00:42 那 GPT 需要什么额外指令? 00:45 Hermes 原是马力有 6 个区块 00:47 前三个长这样 00:49 Tool persistence 00:50 Use tools whenever they improve correctness 00:52 不准提早听守 00:54 Mandatory tool use 00:56 Never answer these from memory. 00:58 数学一路用工计算。 01:00 Don’t ask when a question has an obvious default. 01:03 不准反问。 01:04 直接做后三个区块。 01:07 第四个叫前置检查。 01:09 做任何动作之前, 01:11 先确认前置条件是否满足。 01:14 第五个叫验证。 01:16 从正确型根据各式安全四个维度验证结果。 01:21 第六个叫不起咨询。 01:23 却咨询的时候不准猜测 01:25 一定要用工具查 01:27 不准幻觉 01:28 Gemini的问题完全不同 01:30 需要操作层面的指令 01:32 Hermes原始马力的起条规则包括 01:35 Always use absolute file paths 01:37 用绝对路径 01:39 Use read file to check contents 01:41 before making changes 01:42 先都在改 01:43 Check package 01:44 JSON before importing 01:46 检查以来 01:47 Keep explanatory text brief 01:49 回答要间接 01:50 这些设计有没有学术支持第一篇关键研究来自一个技术部落格,他们用16个模型做测试,只该了几编试着一个变数, 02:02 结果最弱的模型,Growth从6.7%调到6.8%, 02:08 效能提升了整整10倍。 02:10 第二篇关键论文研究的是跨模型的指令版译, 02:15 详细论文编好在画面上, 02:17 他们用7个语言模型做实验 02:20 发现直接把一个模型 02:22 商调好的系统指令板到另一个模型 02:25 小能会下降三成左右 02:28 这清楚地证明了 02:30 系统指令不能直接跨模型使用 02:33 第三篇呢 02:35 是瑞士理工学院的大规模研究 02:38 论文编号也在画面上 02:40 他们测试了138种不同的系统指令 02:45 有两个重要发现 02:47 第一,用AI自动产生的指令 02:50 效果反而更差 02:52 第二,禁制欲 02:54 也就是不要做某件事 02:57 会多花百分之五到二十的思考时间 03:01 但完成率没有提高 03:03 最后做三个总结 03:06 第一,系统指令 03:08 不能直接跨模型办易 03:10 办了销能回调三成 03:12 第二,精准的针对行锈不有用 03:16 但冗长的通用指令反而诱害 03:19 第三 03:20 越弱的模型 03:21 从好的指令中获益越大 03:25 每个结论都有论文支持 03:27 连接都在画面上 03:30 所有今天提到的论文连接和Hermes原始码 03:33 都在影片说明栏 03:35 如果你在开发RI应用 03:38 技术不要用同一套指令套所有模型 03:42 了解每个模型的失败模式 03:44 针对醒秀部 03:46 效果原生通用之灵 03:48 我是小金 03:49 我们下次见