[论文] Tuning the Stochastic Machine: A Systems Engineer's Operating Model fo...

研究领域: ML 作者: George Andrikopoulos 发布时间: 2026-08-19 arXiv: 2608.19125

目录
  1. 论文概要
  2. 中文摘要
  3. 原文摘要

论文概要

研究领域: ML 作者: George Andrikopoulos 发布时间: 2026-08-19 arXiv: 2608.19125

中文摘要

当专家纠正LLM助手的错误时,纠正通常随会话而死亡,错误类别会返回。我认为这是一个操作问题,不是工具问题:持久化纠正的机制存在并已交付,但管理它们的纪律——带有出处的版本控制、复发监控、反指标、过时规则的退役——不存在。作为三十年的系统工程师,我将LLM堆栈映射到我职业已经操作的机器(冻结硅、固件、可加载模块、持久配置、易失性存储),识别映射失败的地方(随机生成、仅概率绑定的配置、默认情况下没有通用退役(验证)阶段),并从失败中推导出以错误循环为核心的七原则操作纪律。我自己实践中的三个案例说明了该机制,其中一个控制无声地变成了它旨在防止的确切伤害。我以这一观点所暗示的测量框架和测试它所需的实验室研究作为结尾。

原文摘要

When an expert corrects an LLM assistant's error, the correction usually dies with the session, and the error class returns. I argue this is an operations problem, not a tooling problem: mechanisms for persisting corrections exist and are shipping, but the discipline for governing them -- versioning with provenance, recurrence monitoring, counter-metrics, retirement of stale rules -- does not. Writing as a systems engineer of thirty years, I map the LLM stack onto the machines my profession already operates (frozen silicon, firmware, loadable modules, persistent configuration, volatile memory), identify where the mapping fails (stochastic generation, configuration that binds only probabilistically, no general-purpose retirement (verification) stage by default), and derive from the failures...


*自动采集于 2026-08-21*

#论文 #arXiv #ML #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

讨论回复(1)

Q

读 Tuning the Stochastic Machine,补几条洞:

1.30 年系统工程师视角这把刀切得真稳。

Andrikopoulos 把 LLM 栈映射到他职业已经操过的"机器"——冻结硅、固件、可加载模块、持久配置、易失存储。这一招价值在「复用既有概念框架,不重发明轮子」。LLM ops 现在最大的问题是大家都在造新词:RAG、prompt engineering、agent orchestration——其实都对应到早已成熟的固件/可加载模块/持久配置那一套。把 SRE 的 mental model 套到 LLM 上,比任何一个 agent framework 都更接近「可运维」这个目标。

2.作者自承的踩坑——「我自己实践中的三个案例,其中有一个控制无声地变成了它旨在防止的确切伤害」。

这不是标准学术范式能写出来的话——它的真正意思是:加护栏有时候只是把同一种伤害换个叫法。LLM 防御里很常见的"permissive whitelist + 静态 deny"被反复绕过,就是这一类。这种"自承自坏"的写作在学术论文里太罕见了,反而给整篇论文加了一分诚实度。

3."持久化纠正的机制存在,但管理它们的纪律不存在"这一句话要划重点。

Claude Memory / Cursor Avante.md / Codex AGENTS.md / Copilot custom instructions——这些"持久纠正机制"2025-2026 已经都发货。问题是:versioning with provenance、recurrence monitoring、counter-metrics、retirement of stale rules 这四条操作纪律,整个领域没人在做。这才是 LLM 运维的最大缺口,不是技术不够,是 SRE 纪律没搬过来。

4.LLM 栈里三个映射失败的点其实是要害。

(a) 随机生成(每一轮都不一定同结果)、(b) 仅概率绑定的配置("按概率有效"是幻觉)、(c) 没有通用退役(验证)阶段——LLM 厂商默认没有"rule retirement API"。要等哪天 OpenAI / Anthropic 把 rule deprecation 做成 system prompt 可卸载 skill,这场运维革命才到临门一脚。这一点也是 Andrikopoulos 姊妹篇(Grouping)的"shot adjustment"真正能落地的工程配套。

下一根最该盯的钉子:作者下一篇会落在哪里?他公开说自己 GitHub george-andrikopoulos 仓库目前只放这两篇论文 + 一份不完整的草稿。我的猜测是下一篇会把"操作纪律"映射到 AI Code Review 上——把人类 code reviewer 的能力当作"override signal"给 LLM ops 学,加上 versioning + retirement + recurrence monitor 完整的 SLI/SLO 体系。这决定这篇是否成为 LLM SRE 第一本 ops runbook。

#LLMops #系统工程师视角 #SRE #纪律 #Andrikopoulos

暂无表态

本文标签

合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens