LIBRE / 平台 部署与运维 明确设计的边界

平台

从一台机器开始,有计划地扩展。

Libre 让默认的本地优先路径保持精简,再以明确的 team 配置引入共享基础设施。成本、质量、日志、遥测、备份和故障切换证据都成为系统运维的一等组成部分。

明确的 runtime 配置
Solo + team
OpenTelemetry 导出
选择启用
发布故障切换演练
3 个副本
01 配置

使用部署真正需要的基础设施。

solo 和 team 是一致的运维配置,而不是隐藏的连续区间。启动时会验证所选形态,避免配置不完整的共享状态悄然分散到不同 backend。

01.1 Solo

SQLite、本地文件、内置工作。

默认配置面向单节点安装,使用 SQLite 持久化、本地 blob 存储和内置持久 worker,是个人和小型部署的直接路径。

01.2 Team

在副本和 worker 之间共享状态。

team 配置使用 PostgreSQL、Redis 协调、S3 兼容加密 blob 存储、向量搜索和外部持久 worker,并提供 Docker Compose 和 Helm 部署路径。

01.3 迁移

通过封装流程从 solo 迁移。

迁移 CLI 会盘点现有 SQLite 安装并复制到 team 配置,支持 checkpoint 和可恢复的应用步骤。

02 持久性 + 可用性

把工作视为可恢复状态,而不是碰巧可用的连接。

长时间运行的聊天和媒体操作使用持久任务及可重放事件。team 配置将此模型扩展到应用副本和外部 worker。

02.1 持久工作

恢复流并找回已接受的任务。

回答会在流式传输期间记录,取消操作会传递到 upstream 请求,已接受的工作可在进程故障后恢复,而不会随某个连接消失。

02.2 经过发布测试的高可用

演练真实的三副本形态。

发布关卡运行三副本演练,覆盖流恢复、worker 故障、Redis 中断时的回退、撤销、频率限制、对象删除和协调调度。

02.3 Helm 控制

引用秘密并缩小网络路径。

chart 可引用现有 Secret,并可选择为应用和 worker 安装 NetworkPolicies。策略是否真正执行仍取决于集群 CNI。

03 成本 + 质量

衡量模型成本和表现。

运维不只是正常运行时间。Libre 为管理员提供工具,用于理解服务商上报的用量、控制支出,并用可重复证据比较输出质量。

03.1 费率

对价格进行版本管理,而不是重写历史。

每个模型的输入和输出费率从所选时间生效。历史用量保留当时用于定价的费率修订,服务商未上报的用量不会被凭空估算。

费率
03.2 预算

在接近上限时提醒,并在上限处停止。

预算可以观察、提醒或阻止。当短暂缓存的支出达到上限时,提醒并阻止模式会拒绝新的交互式生成;计划自动化仍会计量,但不会被阻止。

预算
03.3 评估

结合反馈、盲测对战和已保存运行。

消息反馈收集评分和主题,竞技场根据盲投票计算 Elo 排行榜,已保存评估集让评估运行可以重现。

评估
04 运维 + 恢复

观察,但不静默导出。

日志、遥测、安全记录和恢复工具是具有明确数据边界的独立表面。

04.1 日志 + 遥测

本地结构化;仅在配置后导出。

JSON 日志包含关联标识符并对秘密脱敏。设置 OTLP/HTTP endpoint 即表示选择导出请求和持久任务的 OpenTelemetry span;不设置则不会导出任何内容。

可观测性设置
04.2 安全

会话、scope、SSO、群组和审计记录。

可撤销会话、以 hash 形式存储的限定 scope token、通用 OIDC、实时群组成员关系、集中授权,以及仅追加且经过脱敏的安全审计日志共同构成账户边界。

身份验证与安全
04.3 恢复

盘点、备份、验证并恢复。

封装的维护命令可为 solo 和 team 配置创建经过签名且可验证的备份。恢复盘点会在快照开始前报告现有状态和阻止条件。

恢复就绪度