Skip to content

最佳实践 ​

Demo 跑通和生产可用之间隔着一整个太平洋。这个分类只讲那一段路。

  • 提示工程模式 —— 角色设定、少样本、思维链、结构化输出,各自什么时候起效
  • 上下文工程 —— 上下文窗口是稀缺资源,怎么决定放什么、丢什么
  • 评测(Eval) —— 改了一版 prompt,怎么确定是真的变好了
  • 成本与延迟 —— 缓存、模型分级、批处理,把账单和响应时间同时压下来
  • 安全 —— 提示注入、越权工具调用、输出泄露
  • 可观测性 —— 日志该记什么,出问题怎么复现

一条经验

先做评测集,再调 prompt。没有 20 条固定测试用例之前,所有"效果好像变好了"都是错觉。