HALRO — 每一枚 Token,都有归属。

HALRO

每一枚 Token
都有归属

Self-hosted LLM Gateway

自托管 LLM 网关

Halro 在应用与模型服务之间统一处理凭据、预算、路由、脱敏、审计和用量核算。

运行方式
单个 Go 二进制
外部依赖
无需数据库或缓存
兼容接口
OpenAI / Anthropic
开源协议
Apache-2.0

已内置 Provider Profiles

OpenAIAnthropicAzure OpenAIDeepSeekGeminiAWS Bedrock

为什么需要 Halro

模型调用需要一个独立的控制边界。

应用只持有 Gateway Key 和公开模型别名。Provider 凭据、真实模型、预算与调用记录由 Halro 统一管理。

01

预算在请求发出前生效

先预留预算和并发额度,再访问 Provider;请求结束后按实际 Usage 结算。

reserve → provider I/O → settle
02

重试单独记录

客户端 Request 与 Provider Attempt 分开建模,超时和重试不会被合并成一条模糊记录。

request → attempts[]
03

每笔用量归属到 Project

Token、成本、限流与异常策略沿同一资源链归因,不依赖月底再拆 Provider 账单。

project → route → deployment

一次请求如何通过 Halro

策略在访问 Provider 之前执行。

请求结束后,Halro 使用真实 Usage 结算,并把重试、价格证据和终态写入同一条可追溯链路。

01

识别调用方

Gateway Key 只映射到一个 Project;上游凭据不会发给业务应用。

02

检查请求权限

根据 Project 校验 Route、模型、CIDR、字段与脱敏策略。

03

预留预算与容量

在 Provider I/O 之前执行预算、RPM、TPM 与并发检查。

04

选择 Provider

Route 绑定版本化的 Deployment 与 Provider Profile,不由客户端临时决定。

05

结算并留下证据

记录每次 Attempt 的 Token、成本、延迟、价格证据与最终状态。

Halro 管理后台运行总览,显示请求、Token、成本与异常
内嵌管理后台:请求、Token、成本、成功率与异常使用同一套本地数据。

资源模型

从 Provider 凭据到业务应用,共六层资源。

明确的资源链替代散落在业务代码里的路由、价格与安全规则。

01Credential

上游凭据只留在 Halro

02Provider

绑定访问面与能力证据

03Deployment

锁定模型、版本与价格

04Route

对业务暴露稳定模型别名

05Project

预算、限流与安全边界

06Gateway Key

每个应用独立身份与归属

业务应用 只持有 Gateway Key 和公开模型别名。

Halro 决定真实 Provider、模型版本、价格证据与治理策略。

用量与审计

管理后台直接查看真实调用记录。

先按 Project、Provider 与模型拆解用量,再沿 Request ID 查看每次 Attempt 的 Token、成本、延迟和价格证据。

阅读设计说明
Halro 项目成本归因界面
按 Project 归因
Halro 调用明细与成本证据界面
查看 Provider Attempt

本地启动

先在本机启动一个实例。

Halro 首次运行时创建配置和加密存储,并在终端输出管理后台地址。

~/halrozsh
# clone & start
$ git clone https://github.com/akz142857/Halro.git
$ cd Halro
$ make start
GO 1.26.5+LOOPBACK BY DEFAULTNO EXTERNAL DB

源码与文档

查看 Halro 当前已经实现的接口与边界。

项目以 Apache-2.0 发布;兼容范围与尚未实现的能力都记录在仓库中。