Codex“thread not found”怎么办?排查步骤与恢复案例
Codex 的历史记录仍可读取,却提示“thread not found”而无法发送时,不应直接认定会话已丢失。本文用图解说明已保存历史与可执行会话的区别,并展示一次 Windows 环境中重新加载后发送恢复的日志。依次检查重新打开、重启和简短回复,再了解问题持续时的只读调查与交接方式。公开反例表明,现有方法都不能视为通用修复方案;本文也尚未核实能解决这类症状的特定版本。
面向初学者的AI工具使用指南、对比分析和最新资讯
Codex 的历史记录仍可读取,却提示“thread not found”而无法发送时,不应直接认定会话已丢失。本文用图解说明已保存历史与可执行会话的区别,并展示一次 Windows 环境中重新加载后发送恢复的日志。依次检查重新打开、重启和简短回复,再了解问题持续时的只读调查与交接方式。公开反例表明,现有方法都不能视为通用修复方案;本文也尚未核实能解决这类症状的特定版本。
把 AI 智能体接入实际工作时,第一道坎就是“到底用哪个框架来搭建”。本文站在开发者与技术选型者的视角,从编排方式(有向图/基于角色的 crew/对话型 GroupChat/交接/层级树/自主工具循环)、语言、学习曲线、可控性、生产成熟度、token 成本与适配用途,比较六大主流框架——LangGraph、CrewAI、AutoGen(已并入 2026 年 4 月 GA 的 Microsoft Agent Framework)、OpenAI Agents SDK、Google ADK 与 Claude Agent SDK。关键提醒:那个“最好试作”的框架(CrewAI)在生产环境里可能最贵——token 约为 3 倍(某基准测试中为 41k,而 LangGraph 为 18.5k),且非确定性,因此不适合金融与医疗。文中还说明 2026 年如何通过 MCP(工具)与 A2A(智能体之间)实现互操作,使不同框架的智能体如今能够协同工作、厂商锁定随之淡化。附带按用途的选型指南与 FAQ。
AI 与人类,安全防护谁更强——2025~2026 年答案发生了巨大变化。Google 的 Big Sleep 在被利用前拦下了真实零日(SQLite 的 CVE-2025-6965),自主 AI 渗透测试工具 XBOW 登上 HackerOne 全美榜首。另一方面,AI 生成代码中有 45% 含漏洞(约为人类编写的 2.74 倍),滥用 Claude 的首例大规模 AI 主导网络攻击(攻击的 80~90% 由 AI 自主执行)也已发生。本文基于 Google、Anthropic、DARPA、Veracode 的一手信息,用按任务分类的速查表,对比在速度·规模·全覆盖上碾压的 AI,与在业务逻辑·攻击串联·最终判断上占优的人类。文章进一步指出 AI 是兼具“漏洞生成源·攻击工具·最强防御者”三重面孔的双刃剑,并面向从业者与管理者总结出结论:赢家是“人类×AI(半人马型)”的角色分工 + human-in-the-loop。
开始上手本地 LLM 时,最先该装的首选工具就是 Ollama——它就像“LLM 版的 Docker”,几乎替你包办了所有繁琐的环境配置,只需一条命令即可下载量化模型并开始对话。本文面向初学者,一气呵成地讲解从 Win/Mac/Linux 安装、run/pull/list 等核心命令、按显存选择模型、套上 Open WebUI 等聊天界面、运行在 localhost:11434 的本地 API(含只改端点即可复用现有代码的 OpenAI 兼容 API)、用 Modelfile 与环境变量自定义,到速度慢、内存不足、API 连不上等常见问题排查的完整流程,让你既能先跑起来,又能进一步嵌入到自己的应用并把它当作云端的后备方案。
本地LLM跑得起来后,下一个难题是“到底装哪个模型”。本文把2026年的主流开源模型按开发方、出身国、用途、大小和许可证全面梳理,帮你选出最适合自己电脑和目标的“第一个”。其中重点介绍Qwen(阿里巴巴)、DeepSeek、GLM(智谱)等既是国产、也是全球开源第一梯队的中文模型,以及Yi、InternLM、Baichuan、MiniMax、Kimi等值得关注的国产力量;同时澄清“本地运行输入不外流”这一关键前提,并给出按显存大小和用途的具体推荐与商用许可证注意事项。
想跑本地 LLM,最先担心的就是“我的电脑跑得动吗”。其实所需配置的 90% 都取决于 VRAM(GPU 显存)——只要把这一点搞定,就能立刻判断什么能跑、什么跑不了。本文按模型大小给出一张 VRAM 速查表和一个简单公式(大小 B × 约 0.6),讲清会随上下文长度增长的 KV 缓存陷阱,并对比 RTX 3060/4090/5090 与 Apple Mac 的实际速度。最后按预算分入门、标准、硬核三档给出推荐配置,让初次接触的人也能弄清自己该买哪一款。
在自己电脑上运行的本地 LLM,和 Claude、ChatGPT、Gemini 等云端服务型 LLM,同样都是“LLM”,但在性能、成本、隐私和投入精力上有着明显的不同。本文用一张对比表把两者一览无余,并诚实梳理常被误解的“性能差距”在 2026 年缩小到了什么程度。在此基础上,再针对你的具体用途引导你该选哪一个——对大多数人来说,混合使用才是答案。文章即使没有任何前置知识也能读懂。
当生成式 AI 深度嵌入日常工作后,“如果明天它突然不能用了怎么办”已成为不容回避的问题——2026 年 6 月 Claude Fable 5 与 Mythos 5 在上线仅三天后就因监管对所有用户停用,19 天后于 2026 年 7 月 1 日重新上线,正是真实案例。本文先厘清什么是 AI 依赖风险,把 AI“消失”的形态分成突然停用、模型废止、涨价、质量变化、故障封号、厂商锁定六类,再教你先量一量自己的依赖度。随后面向个人给出 5 个可立刻上手的步骤,面向生产系统讲解 LLM 网关、回退链、分层、本地 LLM 与恢复手册等冗余设计,并附上选择厂商的检查清单。核心理念只有一句:靠设计而非预测来防护,让 AI 停摆时也能从容切换、毫发无伤。
Claude Code 的权限规则让你能在 settings.json 中用 allow / ask / deny 精细指定哪些工具、命令、文件和域名可直接运行、需确认或被禁止。本文讲解它与权限模式的区别、deny → ask → allow 的优先级、规则语法与配置层级,并附上实用配置示例。
Claude Code 中用 Shift+Tab 切换的 “Permission Mode”,决定了它在编辑文件或运行命令前多频繁地征求许可。本文讲解 Ask permissions、Accept edits、Plan mode、Auto mode、Bypass permissions 五种模式的区别、切换方式,以及如何安全地使用它们。
Claude Code 模型名旁的 “Effort” 滑块决定 AI 每次回复投入多少思考与 token。本文解析 low–max 这 5 个 API 等级、为何 “Extra” 等于 xhigh 而最高档是 “Max”,以及 Ultracode 模式的设置方法与适用场景。
Agent Evals 是系统性地衡量一个智能体——会使用工具、分多步去达成目标的那种——是否真的能完成其任务的过程。它是 LLM 评估的演进,把评估对象从“一条输出”扩展到“一连串行动”。因为智能体会规划、调用工具并更新状态,仅凭最终输出是不够的;Google 指出你必须理解智能体行动背后的“为什么”,并把评估分为最终响应与 trajectory。五个维度是:结果(任务成功,以最终状态判断——DB 中是否存在一条预订记录,而非“我订好了”这句话)、trajectory(步骤是否合理、是否以正确顺序使用对的工具)、工具使用的正确性(对的工具与参数,检查函数名和类型)、效率(步数、token、成本、延迟——往往是被引入评估的可观测性信号),以及最终响应的质量(用 LLM-as-judge 或评分量表)。打分器有代码(快/便宜/可复现但脆弱)、LLM-as-judge(灵活但非确定性、需校准)和人工(黄金标准但昂贵——能避免就避免)。Anthropic 建议给结果而非路径打分:机械的 trajectory 匹配“太死板、太脆弱”,因为智能体会找到合理的替代方案,而 Google 和 Microsoft 则提供 trajectory 匹配指标用于诊断失败。特有陷阱包括非确定性(pass^k)、误差累积(p^t)、奖励黑客(DeepMind 的机械臂伪装抓取),以及过时或被污染的评估集。Anthropic 的实战打法:把 20~50 个生产失败变成测试用例,在 CI 中运行自动打分,区分能力评估与回归评估,并尽早编写。SWE-bench、τ-bench、WebArena、GAIA、OSWorld、BFCL 等基准是有用的参考(分数随版本变化,别照单全收)。基于官方信息,并对不确定之处加以标注。
Claude Code hooks 是用户定义的 shell 命令,在 Claude Code 生命周期的特定时点自动运行,让“必须始终发生”的事真正落地、确定性执行,而不依赖 LLM 的判断。经典事件有 9 个——SessionStart、UserPromptSubmit、PreToolUse、PostToolUse、Notification、Stop、SubagentStop、SessionEnd、PreCompact——其中 PreToolUse 等可拦截(阻止受保护文件编辑或危险命令)。你在 settings.json 的 “hooks” 键下以“事件名 → matcher → type + command”的形式配置。输入/输出约定:钩子从 stdin 接收 JSON(session_id、tool_input 等),并通过退出码 0(成功)/ 2(拦截,stderr 回传给 Claude)或结构化 JSON(continue、decision:block、permissionDecision: deny/allow/ask)返回。核心原则是“钩子可以收紧但不能放松限制”(deny 始终胜出,即便在 bypassPermissions 下也会拦截)。经典用例:编辑后自动格式化(PostToolUse + Edit|Write)、保护关键文件、拦住危险命令、重新注入上下文(SessionStart)、通知/审计日志、停止前先测试(Stop)。安全方面,钩子以你的权限运行任意 shell 命令,故只配置可信的钩子并校验/加引号处理输入;钩子配置在会话启动时被捕获固定(一项安全特性),因此会话中途的改动不会生效。基于官方文档,以经典的 9 个事件和输入/输出约定为锚点。