网络设置


Key 授权分发

Key 批量生成
Key 管理
共检索到 0 个 Key
Key-ID 状态 Token 用量 ⬇️ 创建日期 动作
每页显示:
1 / 1

系统管理

系统
界面

修改管理员密码

界面语言

可用语言来自 static/lang 目录中的 JSON 文件。语言包缺失或未覆盖的文本将继续显示程序原生文本,不影响系统运行。

当前检测到 0 个可用语言包

算力配置 (API 聚合)

大模型 API 设置
Embedding API 设置
备份
👁️ 单Key模式
🔍 自动检测
ℹ️帮助

[这些参数将直接注入请求体,支持布尔值、数字和字符串。保存前请先验证]

👁️ 单Key模式
⚠️ 跨设备迁移警告
* 为保证模型 Key 安全,所有Key均已被加密并绑定当前设备绝对不能直接拷贝 system.db 到其它设备使用,这会导致解密失败至模型的 Key 无法读取。
* 在迁移本系统到新设备时,请务必先在此处导出明文 JSON 备份,再到新设备导入。(当前版本已移除跨设备迁移限制,但模型key依然以加密方式存放)

算力负载引擎

同模型聚合负载
多模型混合负载

同厂商算力聚合突破并发瓶颈。引擎会利用您在配置中输入的多个 Key 进行请求次序上的绝对轮询。跨模型聚合可能会导致输出效果不一,这里仅列出拥有 >=2 个 Key 的模型配置。

LM 模型可聚合、混合或者聚合+混合形成超混,而 Embedding 模型仅支持多 Key 聚合以获得向量计算加速以及文本上传加速,但不支持混合使用,因为不同模型维度不同,向量计算方式不同。
LM 聚合
Embedding 聚合

多厂商混合负载 (按请求次序轮流使用)。如果选中的模型中存在“聚合模型”,则会在该模型内部完成一次多 Key 轮询循环后,再流转至下一个厂商。绑定后,算力分配中的主次大模型将被强制接管。

算力模型分配

大模型分配
Embedding 分配
Reranker 模型分配

知识检索骨骼 (Embedding Model) 用于把文本转化为密集向量并写入 SQLite。强烈建议挂载后不要随意切换,一旦底层模型变更,系统将要求清空所有已建立的向量数据!

* 目前Deepnow RAG系统已使用了vector+jaccard+ncd 的方式进行精确语义级的检索,语义精确度已完全超过很多商业检索系统,但我们希望以后的版本中能加入 Reranker 模型和注入算法来进一步增强RAG召回精度,让喂入检索系统的知识看起来像大模型原生。

知识库配置中心

📁
知识文件 0
🧩
索引切片 0
🕒
最后更新
📐
窗口 / 重叠 800 / 200
🏷️
分类数 0
🧬
向量维度 未知
知识管理
知识上传
共检索到 0 个文件
文件名 类型 唯一ID Chunks 上传时间 状态 动作
每页 1 / 1

批量上传知识文件(仅支持 .txt),系统将自动进行向量化切片。请先确保 Embedding 模型已激活。

单次最多 5 个文件

上传进度

文件名 类型 完成进度

集成验证工具

大模型连通验证
RAG 召回验证

完全模拟外部真实用户的网关召回逻辑。一旦开启大模型裁决,系统将严格依据当前底座的负载分发(轮询/降级/超混)策略去寻找推理引擎。

规则化配置

大模型规则
RAG 规则
🧠
大模型规则中心

集中管理生成采样、思维链渲染、输出净化与上游 SSE 保护策略。所有配置会在网关层统一生效,并尽量保持客户端原始请求不被无意义改写。

🌡️

控制生成内容随机性;关闭时保留客户端原始 temperature。

建议范围:0.1 - 1.2
🧩

控制旁路思维块与类 think 标签面向客户端输出的方式,内部仍保持 content 与 reasoning 分离。

适配:按目标协议或客户端 Adapter 渲染思考区 内联:去标签后并入正文输出 丢弃:保留上下文旁路思维块,但不向客户端输出
🧼

Non-SSE 最终输出层保护,用于清理正文 content 中意外泄漏的完整闭合类 think 标签块。

<think> <thinking> <thought> <reasoning> <summary>
⏱️

防止上游 SSE 半开或长时间无事件导致客户端无限等待;填 0 表示关闭对应保护。

默认:首包 300 秒,流中空闲 120 秒;本地慢模型可适当调大。

保存前提示

修改后会写入 system.db 并立即影响后续网关请求。

📚
RAG 规则中心

集中管理知识注入策略、召回阈值与检索质量边界;在保证回答自然度的同时,控制知识库对大模型输出的介入强度。

🧭

决定请求在普通大模型直出、优先知识增强与强制知识拦截之间如何切换。

大模型直接返回不注入知识库内容 优先 RAG召回命中时增强回答 强制 RAG 拦截更严格依赖知识库
🎚️

设置最低余弦相似度要求;低于阈值的切片将被丢弃,推荐值为 0.5。

可选范围:0.00 - 1.00
NCD 验证 Jaccard 过滤 Vector 召回
🧪

阈值越高越能过滤无关噪音,但也可能减少可用知识;阈值越低召回更宽松,适合知识库内容较少或语义跨度较大的场景。

低阈值:提高召回覆盖率 中阈值:平衡准确率与覆盖率 高阈值:优先过滤噪音
保存前提示

RAG 规则会影响后续知识注入与检索拦截策略,建议先使用“RAG 召回验证”测试命中效果。

MCP 配置中心

远程 MCP 路由配置
内建 MCP 插件配置

远程 Streamable HTTP MCP

连接远程 MCP Server,发现工具后由 DeepNow 的原生 /mcp Endpoint 统一聚合和路由。

新增远程 MCP

未保存
HTTP/HTTPS 将根据 Endpoint 自动识别;HTTPS 始终执行标准 TLS 证书校验。

MCP 工具快照

工具由远程 tools/list 自动发现;对外名称固定为“命名空间__原始工具名”。

0 个工具
对外工具名远程工具名描述启用对外暴露

Tips: 勾选结果即时生效,无需再次保存配置。

🧩

内建 MCP 插件配置

功能开发中。后续由 DeepNow Gateway 托管执行内建插件,并通过统一 Canonical Tool 结构向各协议投影。

API 开发接入说明

DeepNow 已完整实现了对标 OpenAI 的格式兼容层。您的客户端只需像对接原生模型一样修改 Endpoint 即可无缝享受 RAG 与算力集群加速。

POST https://[您的域名或IP]:8443/v1/chat/completions
Content-Type: application/json
Authorization: Bearer sk-deepnow-xxxxxx

{
  "model": "ignored_by_gateway",
  "messages": [{"role": "user", "content": "你好"}]
}