<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>AI Agent 与 LLM on Shelter</title><link>https://allen0125.com/categories/ai-agent-%E4%B8%8E-llm/</link><description>Recent content in AI Agent 与 LLM on Shelter</description><generator>Hugo -- gohugo.io</generator><language>zh-cn</language><lastBuildDate>Sun, 24 May 2026 12:00:00 +0800</lastBuildDate><atom:link href="https://allen0125.com/categories/ai-agent-%E4%B8%8E-llm/index.xml" rel="self" type="application/rss+xml"/><item><title>给 Agent 留一份小考卷，比凭感觉换模型靠谱</title><link>https://allen0125.com/posts/agent-small-eval/</link><pubDate>Sun, 24 May 2026 12:00:00 +0800</pubDate><guid>https://allen0125.com/posts/agent-small-eval/</guid><description>&lt;p>同一个任务，这次做得很好，下次却漏一半。靠印象评价 Agent，最后经常变成“今天感觉聪明一点”。&lt;/p>
&lt;p>我更愿意先攒一份小考卷。数量可以少，但每道题都应该知道怎样判分，尤其要收进去那些让人返工的失败。&lt;/p></description></item><item><title>RAG 答错了，先把检索结果摊开看</title><link>https://allen0125.com/posts/rag-source-before-model/</link><pubDate>Sun, 08 Mar 2026 12:00:00 +0800</pubDate><guid>https://allen0125.com/posts/rag-source-before-model/</guid><description>&lt;p>给知识库换一个更大的模型，答案还是错。此时很容易继续改提示词：必须准确、必须引用、没有依据不要回答。可如果正确的那段资料根本没被取回来，这几句要求没有多少发挥空间。&lt;/p></description></item><item><title>给 Agent 的工具加上重试之前，先想想会不会做两遍</title><link>https://allen0125.com/posts/agent-tools-retry/</link><pubDate>Sat, 13 Dec 2025 12:00:00 +0800</pubDate><guid>https://allen0125.com/posts/agent-tools-retry/</guid><description>&lt;p>请求超时以后，再发一次，大多数时候看起来都没问题。可如果刚才那次已经创建了文件，只是回复没传回来，重试就会再创建一份。&lt;/p>
&lt;p>Agent 很容易遇到这种情况。它看见工具没有返回成功，于是换个参数、换个标题，继续尝试。最后任务完成了，文件夹里也多了三个版本。&lt;/p></description></item><item><title>LLM 吐出了 JSON，程序就能放心接了吗</title><link>https://allen0125.com/posts/llm-json-validation/</link><pubDate>Sun, 26 Oct 2025 12:00:00 +0800</pubDate><guid>https://allen0125.com/posts/llm-json-validation/</guid><description>&lt;p>让模型“只返回 JSON”，通常是把它接进程序的第一步。可 JSON 能解析，和结果能使用，中间还隔着几道门。&lt;/p>
&lt;p>假设要给博客文章打分类。模型返回了 &lt;code>{&amp;quot;category&amp;quot;: &amp;quot;电影&amp;quot;, &amp;quot;confidence&amp;quot;: 1.2}&lt;/code>。语法没问题，但站点只允许技术、汽车、摄影三类，置信度也不应该超过 1。直接存进去，后面的分类页面才会发现问题。&lt;/p></description></item><item><title>Agent 一直在忙，怎样才算把事情做完了？</title><link>https://allen0125.com/posts/agent-stop-condition/</link><pubDate>Sat, 12 Jul 2025 12:00:00 +0800</pubDate><guid>https://allen0125.com/posts/agent-stop-condition/</guid><description>&lt;p>一个 Agent 连续调用了十几次工具，最后回复“已经完成”。先别急着高兴。它可能只是把计划写得很完整，也可能拿到一次超时，就把那个链接判成了失效。&lt;/p>
&lt;p>我更关心它能交出什么证据。比如检查博客里的链接，结果应该能回答：检查了哪些地址，哪些确实坏了，哪些只是暂时查不到。把这几件事说清楚，比让它多想两轮有用。&lt;/p></description></item></channel></rss>