site logo

Marico's space

折腾 AI Agent 有一段时间了,调 system prompt、试 chain-of-thought、跑 ReAct、把 GPT-4o 和 Claude 3.5 Sonnet 比了个遍,结果呢?Agent 还是在第三轮对话就失忆、还是前后矛盾、用户第二天回来感觉像在跟一个新人聊天。 说句可能被喷的实话:你的 Agent 根本不是推理有问题,是记忆有问题。 现在的大模型在给定的上下文窗口内
最近折腾贷款技术栈的架构选型,踩了几个坑,这篇把问题说清楚。 你的工程团队用四到六周就能搭一个 API(应用程序接口)聚合层。它从征信机构、KYC(了解你的客户)供应商、文档服务、合作贷款方拉取数据,标准化响应格式,然后返回给前端一个统一的对象。跑得起来。 但放到贷款发起流程里,这就埋雷了。 贷款 API 编排和 API 聚合的区别,不是学术架构讨论。这是选择哪种模式真正匹配贷款业务流程结构
随着企业纷纷把GPT-4这类大语言模型(LLM,大语言模型)集成到自家平台,他们很快会遇到一个致命问题:LLM会一本正经地胡说八道。这种现象叫"幻觉"(hallucination),本质原因是LLM本质上只是个概率预测引擎。如果你问一个现成的LLM关于昨天刚写的某条绝密公司政策,它不知道答案——但它不会说"我不知道",而是会自信满满地编出一段语法完美、逻辑通顺、但完全虚构的内容。 在企业软件领域
最近在搞AI评估平台,踩了不少坑,终于把事件驱动这套东西跑通了。这篇把GCP上Pub/Sub、Cloud Tasks和Cloud Scheduler的实际用法说清楚,不整虚的。 为什么需要事件驱动 AI评估平台有个问题,用REST API根本没法优雅地解决:一个评估任务跑5到30分钟,涉及6个不同服务,中间随时可能挂。 用同步HTTP:超时、重试撞上已经完成的任务、调试噩梦。换成事件驱动:
最近折腾了几个月AI自动化接单,踩了不少坑,也跑通了几条能来钱的路子。这篇把企业真正愿意掏钱的AI自动化场景梳理清楚,顺手带做一个完整的demo——用n8n、OpenAI和Webhook搭一个AI增强的线索入库流程。适合想接这类项目的开发者,也适合想自己搭自动化管线的运营同学。 > 说白了,企业只会为直接影響现金流或客户体验的自动化买单。 什么是AI自动化 AI自动化本质是一条工作流:触发
最近折腾了一下临床试验技术栈,发现这玩意儿正在经历一场基础设施级别的重构。试验复杂度蹭蹭往上涨——分散化模式、跨国多中心方案、海量数据膨胀——运营摩擦的成本已经扛不住了。国内一个III期临床试验,每天直接成本动不动几万甚至几十万。但大多数进度延误的原因根本不是科学问题,而是运营层面的死锁:中心启动卡脖子、方案修订乱成一锅粥、数据孤岛到处都是。 GeekyAnts 之前发了一篇临床试验管理软件开发
上个月参与维护的一个开源项目,一周之内涌进来 40 个 issue。手工分类花了四个小时:读内容、打标签、定优先级、回复。动念头想上个 Agent 帮我做第一轮筛选。问题是:项目没钱买云资源,没 GPU,也没有任何 AI 预算。 零预算不是口号,是硬约束。 背景 这个仓库收到的 issue 包括 bug 报告、功能需求、环境配置问题各种混在一起。大部分 issue 篇幅不长,但有些会带上一
最近折腾了 AI Agent Loop 的计划自动化,踩了几个坑,这篇把问题说清楚。 一个 Loop 能叫 Loop,得靠你没手动触发它、它自己在跑。三种心跳方式:会话内 /loop(你在键盘前)、云端 Routines(cron 定时任务,笔记本合上)、CI(GitHub Actions)。选哪个取决于工作在哪、谁需要醒着。然后:把发现的结果发到人工审核的收件箱,让空跑几乎不花钱——因为按天跑
最近折腾了把对象存储从阿里云 OSS 迁到 Cloudflare R2,迁移前做了番审计,结果发现团队在缓存命中率上踩了个坑——这个坑本来半天就能修好,但如果没发现就迁移,等于花时间和钱去掩盖一个本来能解决的问题。这篇把审计方法和判断逻辑说清楚。 有篇讨论存储流出费用的帖子里有句话说得在理:动任何东西之前,先搞清楚你到底在服务多少不同的资源,有多少是从缓存来的。 为什么我的流出账单和下载量对
最近折腾把项目里的提示词(Prompt)从代码里搬出来,踩了几个坑,这篇把过程记录下来。 大多数AI(人工智能)应用起步时,提示词都是直接写在代码里的: const systemPrompt = ` 你是客服助手。 回答要清晰,账单问题要升级处理。 `; 做原型阶段这样写完全没问题。 但当应用里有了多个提示词、团队有多个贡献者、线上用户在依赖这个行为时,问题就来了。 这时候团队会想把提
共 420 条, 共 42 页