site logo

Marico's space

Claude Code 很乐意帮你写测试,也很乐意告诉你测试通过了。这两个声明之间隔着一道沟——大多数 QA 自动化配置,就是在这道沟里悄悄死掉的。 这篇文章聊聊怎么把 Claude Code 塞进一个真正管用的 QA 循环:它什么时候可以放手跑,你会踩到哪三个坑,以及怎么把它们堵上。 为什么"帮我写点测试"不等于 QA 自动化 标准的做法是让 Claude Code 生成一套测试用例。很
最近给一个企业级多租户系统做安全加固,踩了几个坑才把 PostgreSQL 行级安全性(RLS)跑通。这篇把核心思路和具体实现说清楚,少走弯路。 应用层租户隔离的致命缺陷 做 B2B SaaS 平台,数据隔离是头等大事。一旦租户 A 能看到租户 B 的财务数据,轻则面临 SOC 2、GDPR 合规处罚,重则丢失企业客户,信誉扫地。 大多数 Laravel 开发者会用应用层安全来解决这个问题
最近折腾了 Graftcode 这个工具,踩了几个坑,这篇把经验说清楚。做前端的同学估计都有同感:每次搭个项目,光是前后端通信这块就要写一堆重复代码——定义接口、写请求封装、处理响应格式、维护类型定义。REST API 那套流程熟悉得很,但确实繁琐。 Graftcode 这个工具解决的就是这个问题:不用写 API 路由、不用生成客户端,直接把后端方法暴露出来,前端像调用本地库一样调用。我用它搭了
你的 RAG 系统正在用同一种方式处理所有查询。 不是那种灾难性的错误。是一种固定的、程序化的错误。 不管来的是什么问题——简单的知识点查询、复杂的多跳推理任务,还是模型早就知道答案根本不需要检索的情况——它都检索同样数量的文档,用同样的策略。 这种"一刀切"的方案是当前生产环境 RAG 系统中最主要的成本浪费和质量损失的来源。而且这不是模型的问题,是架构的问题。 自适应 RAG 的解决思
最近把阿里云上的几个项目做了次成本审计,顺手把AWS那三板斧——Trusted Advisor、Compute Optimizer和Cost Explorer——拿来仔细对比了一番。市面上的对比文章都在列功能清单,说实话意义不大。真正该问的问题是:在这个季度你能回收的那笔钱里,每个工具能看见多少? 换这个角度看问题,结论完全不一样。这三个工具在各自的领域都做得不错,但问题在于——它们共同忽视的那
最近折腾了 AI agent 的执行效率问题,踩了几个坑,这篇把问题说清楚。 当你给 AI agent 配上工具去完成一个真实的业务任务,它做的事情里有多少是真正有用的任务,又有多少只是在找方向——摸索 schema、把原始数据塞进 context、反反复复读数据、祈祷自己没漏掉某个字段? 我做了个配对基准测试来直接测量这个差距。用的工具是 Foundgine,一个开源的 .NET 语义执行层
2026年6月底,团队GitHub Actions撞到了账单上限。每个PR(pull request,代码评审请求)的CI(持续集成,指每次代码变更自动运行测试的系统)检查都在2秒内失败,日志里空空如也。与此同时,Slack里的插件发布通知也停了。代码一行都没动过,是外部服务因为账单问题直接把我的基础设施掐断了。 当时我跑的是GitHub Actions免费额度。但免费额度用完了,CI被卡住,要
HERMES SOUL 与 COPILOT SHELL:VS CODE 中 HERMES AGENT 的内联编辑 受够了这种二选一。Copilot 的内联编辑体验确实最顺手——Tab 接受修改、编辑预览直接显示在 VS Code 里。但它不会跟着你成长:每次会话都是全新的,没有工具、没有记忆,一旦离开编辑器它就不存在了。而我的 Agent(Hermes)什么都有——记忆、工具、MCP 服务器、子
最近折腾了一套基于 LangChain 的语音智能体,踩了几个坑,这篇把问题说清楚。 构建语音智能体不是简单地把语音转文字、再接个大模型、最后转回语音就完事了。 真正的难题是:怎么让 AI 系统听得懂、推理得出、调用工具、记住上下文、还得响应够快,让对话保持自然感? LangChain 能处理智能体和工具编排层,但实时体验很大程度上取决于它周围的东西。一个实用的架构大概长这样: User
最近折腾移动端自动化,发现这个领域正在发生一个有意思的范式转换。传统的自动化是"录个脚本,反复回放",这成就了整个 RPA(机器人流程自动化)行业,但也附带了一套永无止境的维护工作。而 Mobile AI Agents 给你的是另一种交易:告诉我你想要什么结果,系统自己去琢磨步骤怎么走。今天把这两个方案掰开了聊聊。 RPA 是怎么工作的,以及为什么它不理想 RPA 算是办公室里最早一批的自动
共 407 条, 共 41 页