跳到内容

AI工具使用指南、对比分析、最新资讯

面向初学者的AI工具使用指南、对比分析和最新资讯

精选文章

Codex“thread not found”怎么办?排查步骤与恢复案例
Codex AI开发与编程

Codex“thread not found”怎么办?排查步骤与恢复案例

Codex 的历史记录仍可读取,却提示“thread not found”而无法发送时,不应直接认定会话已丢失。本文用图解说明已保存历史与可执行会话的区别,并展示一次 Windows 环境中重新加载后发送恢复的日志。依次检查重新打开、重启和简短回复,再了解问题持续时的只读调查与交接方式。公开反例表明,现有方法都不能视为通用修复方案;本文也尚未核实能解决这类症状的特定版本。

最新文章

214 篇文章
AI 智能体框架对比 2026:LangGraph、CrewAI、AutoGen、OpenAI、Google、Claude——该选哪个?

AI 智能体框架对比 2026:LangGraph、CrewAI、AutoGen、OpenAI、Google、Claude——该选哪个?

把 AI 智能体接入实际工作时,第一道坎就是“到底用哪个框架来搭建”。本文站在开发者与技术选型者的视角,从编排方式(有向图/基于角色的 crew/对话型 GroupChat/交接/层级树/自主工具循环)、语言、学习曲线、可控性、生产成熟度、token 成本与适配用途,比较六大主流框架——LangGraph、CrewAI、AutoGen(已并入 2026 年 4 月 GA 的 Microsoft Agent Framework)、OpenAI Agents SDK、Google ADK 与 Claude Agent SDK。关键提醒:那个“最好试作”的框架(CrewAI)在生产环境里可能最贵——token 约为 3 倍(某基准测试中为 41k,而 LangGraph 为 18.5k),且非确定性,因此不适合金融与医疗。文中还说明 2026 年如何通过 MCP(工具)与 A2A(智能体之间)实现互操作,使不同框架的智能体如今能够协同工作、厂商锁定随之淡化。附带按用途的选型指南与 FAQ。

AI 与人类,安全防护谁更强?用 2026 年的实力彻底对比

AI 与人类,安全防护谁更强?用 2026 年的实力彻底对比

AI 与人类,安全防护谁更强——2025~2026 年答案发生了巨大变化。Google 的 Big Sleep 在被利用前拦下了真实零日(SQLite 的 CVE-2025-6965),自主 AI 渗透测试工具 XBOW 登上 HackerOne 全美榜首。另一方面,AI 生成代码中有 45% 含漏洞(约为人类编写的 2.74 倍),滥用 Claude 的首例大规模 AI 主导网络攻击(攻击的 80~90% 由 AI 自主执行)也已发生。本文基于 Google、Anthropic、DARPA、Veracode 的一手信息,用按任务分类的速查表,对比在速度·规模·全覆盖上碾压的 AI,与在业务逻辑·攻击串联·最终判断上占优的人类。文章进一步指出 AI 是兼具“漏洞生成源·攻击工具·最强防御者”三重面孔的双刃剑,并面向从业者与管理者总结出结论:赢家是“人类×AI(半人马型)”的角色分工 + human-in-the-loop。

Ollama 完全入门指南:本地 LLM 一条命令搞定 [2026]

Ollama 完全入门指南:本地 LLM 一条命令搞定 [2026]

开始上手本地 LLM 时,最先该装的首选工具就是 Ollama——它就像“LLM 版的 Docker”,几乎替你包办了所有繁琐的环境配置,只需一条命令即可下载量化模型并开始对话。本文面向初学者,一气呵成地讲解从 Win/Mac/Linux 安装、run/pull/list 等核心命令、按显存选择模型、套上 Open WebUI 等聊天界面、运行在 localhost:11434 的本地 API(含只改端点即可复用现有代码的 OpenAI 兼容 API)、用 Modelfile 与环境变量自定义,到速度慢、内存不足、API 连不上等常见问题排查的完整流程,让你既能先跑起来,又能进一步嵌入到自己的应用并把它当作云端的后备方案。

2026年最佳本地LLM开源模型对比:Qwen·DeepSeek·Llama·Gemma怎么选 [2026]

2026年最佳本地LLM开源模型对比:Qwen·DeepSeek·Llama·Gemma怎么选 [2026]

本地LLM跑得起来后,下一个难题是“到底装哪个模型”。本文把2026年的主流开源模型按开发方、出身国、用途、大小和许可证全面梳理,帮你选出最适合自己电脑和目标的“第一个”。其中重点介绍Qwen(阿里巴巴)、DeepSeek、GLM(智谱)等既是国产、也是全球开源第一梯队的中文模型,以及Yi、InternLM、Baichuan、MiniMax、Kimi等值得关注的国产力量;同时澄清“本地运行输入不外流”这一关键前提,并给出按显存大小和用途的具体推荐与商用许可证注意事项。

本地 LLM 需要什么硬件?显存(VRAM)速查表与按预算推荐配置 [2026]

本地 LLM 需要什么硬件?显存(VRAM)速查表与按预算推荐配置 [2026]

想跑本地 LLM,最先担心的就是“我的电脑跑得动吗”。其实所需配置的 90% 都取决于 VRAM(GPU 显存)——只要把这一点搞定,就能立刻判断什么能跑、什么跑不了。本文按模型大小给出一张 VRAM 速查表和一个简单公式(大小 B × 约 0.6),讲清会随上下文长度增长的 KV 缓存陷阱,并对比 RTX 3060/4090/5090 与 Apple Mac 的实际速度。最后按预算分入门、标准、硬核三档给出推荐配置,让初次接触的人也能弄清自己该买哪一款。

本地 LLM vs 云端 LLM:区别与性能差距 [2026]

本地 LLM vs 云端 LLM:区别与性能差距 [2026]

在自己电脑上运行的本地 LLM,和 Claude、ChatGPT、Gemini 等云端服务型 LLM,同样都是“LLM”,但在性能、成本、隐私和投入精力上有着明显的不同。本文用一张对比表把两者一览无余,并诚实梳理常被误解的“性能差距”在 2026 年缩小到了什么程度。在此基础上,再针对你的具体用途引导你该选哪一个——对大多数人来说,混合使用才是答案。文章即使没有任何前置知识也能读懂。

什么是 AI 依赖风险?当某个 AI 突然停摆时该如何准备

什么是 AI 依赖风险?当某个 AI 突然停摆时该如何准备

当生成式 AI 深度嵌入日常工作后,“如果明天它突然不能用了怎么办”已成为不容回避的问题——2026 年 6 月 Claude Fable 5 与 Mythos 5 在上线仅三天后就因监管对所有用户停用,19 天后于 2026 年 7 月 1 日重新上线,正是真实案例。本文先厘清什么是 AI 依赖风险,把 AI“消失”的形态分成突然停用、模型废止、涨价、质量变化、故障封号、厂商锁定六类,再教你先量一量自己的依赖度。随后面向个人给出 5 个可立刻上手的步骤,面向生产系统讲解 LLM 网关、回退链、分层、本地 LLM 与恢复手册等冗余设计,并附上选择厂商的检查清单。核心理念只有一句:靠设计而非预测来防护,让 AI 停摆时也能从容切换、毫发无伤。

什么是 Agent Evals?同时衡量结果与 trajectory

什么是 Agent Evals?同时衡量结果与 trajectory

Agent Evals 是系统性地衡量一个智能体——会使用工具、分多步去达成目标的那种——是否真的能完成其任务的过程。它是 LLM 评估的演进,把评估对象从“一条输出”扩展到“一连串行动”。因为智能体会规划、调用工具并更新状态,仅凭最终输出是不够的;Google 指出你必须理解智能体行动背后的“为什么”,并把评估分为最终响应与 trajectory。五个维度是:结果(任务成功,以最终状态判断——DB 中是否存在一条预订记录,而非“我订好了”这句话)、trajectory(步骤是否合理、是否以正确顺序使用对的工具)、工具使用的正确性(对的工具与参数,检查函数名和类型)、效率(步数、token、成本、延迟——往往是被引入评估的可观测性信号),以及最终响应的质量(用 LLM-as-judge 或评分量表)。打分器有代码(快/便宜/可复现但脆弱)、LLM-as-judge(灵活但非确定性、需校准)和人工(黄金标准但昂贵——能避免就避免)。Anthropic 建议给结果而非路径打分:机械的 trajectory 匹配“太死板、太脆弱”,因为智能体会找到合理的替代方案,而 Google 和 Microsoft 则提供 trajectory 匹配指标用于诊断失败。特有陷阱包括非确定性(pass^k)、误差累积(p^t)、奖励黑客(DeepMind 的机械臂伪装抓取),以及过时或被污染的评估集。Anthropic 的实战打法:把 20~50 个生产失败变成测试用例,在 CI 中运行自动打分,区分能力评估与回归评估,并尽早编写。SWE-bench、τ-bench、WebArena、GAIA、OSWorld、BFCL 等基准是有用的参考(分数随版本变化,别照单全收)。基于官方信息,并对不确定之处加以标注。

什么是 Claude Code hooks?确定性地运行 shell 命令

什么是 Claude Code hooks?确定性地运行 shell 命令

Claude Code hooks 是用户定义的 shell 命令,在 Claude Code 生命周期的特定时点自动运行,让“必须始终发生”的事真正落地、确定性执行,而不依赖 LLM 的判断。经典事件有 9 个——SessionStart、UserPromptSubmit、PreToolUse、PostToolUse、Notification、Stop、SubagentStop、SessionEnd、PreCompact——其中 PreToolUse 等可拦截(阻止受保护文件编辑或危险命令)。你在 settings.json 的 “hooks” 键下以“事件名 → matcher → type + command”的形式配置。输入/输出约定:钩子从 stdin 接收 JSON(session_id、tool_input 等),并通过退出码 0(成功)/ 2(拦截,stderr 回传给 Claude)或结构化 JSON(continue、decision:block、permissionDecision: deny/allow/ask)返回。核心原则是“钩子可以收紧但不能放松限制”(deny 始终胜出,即便在 bypassPermissions 下也会拦截)。经典用例:编辑后自动格式化(PostToolUse + Edit|Write)、保护关键文件、拦住危险命令、重新注入上下文(SessionStart)、通知/审计日志、停止前先测试(Stop)。安全方面,钩子以你的权限运行任意 shell 命令,故只配置可信的钩子并校验/加引号处理输入;钩子配置在会话启动时被捕获固定(一项安全特性),因此会话中途的改动不会生效。基于官方文档,以经典的 9 个事件和输入/输出约定为锚点。

按分类浏览

GitHub Copilot

查看全部

Midjourney

查看全部

Stable Diffusion

查看全部

新手入门

查看全部

AI开发与编程

查看全部

开发环境与基础设施

查看全部

AI代理与自动化

查看全部

工作效率

查看全部

数据分析

查看全部

学习与教育

查看全部

副业与变现

查看全部

游戏开发

查看全部

AI安全与治理

查看全部

AI风险与社会影响

查看全部

个人开发

查看全部