v0.4.0
v0.4.0 —— 上下文压缩(memory 插件)+ 工具回路 + Markdown 渲染
自 v0.3.0 以来,重点是让长对话"记得住":按项目插件哲学(内核只负责插拔,
能力全部来自插件)新增独立的 memory 插件,把 chat 的可用上下文管理做成
"评分 → 分级保留 → 压缩 → 持久化"管线;同时给模型接入本地工具回路,
回复支持 Markdown 渲染。
新功能
- memory 插件(上下文压缩/记忆,论证见本地文档 context-compression.md):
- 逐条后台评分:每条交互由模型打 1~5 分(S 约束/A 事实/B 一般/C 低/D 无意义),
评分跟随历史条目,主调用零延迟(后台线程,本地调用零成本); - 分级保留:S 级关键记忆(约束/决定/偏好)原样入库、不计入预算;A/B 级
压缩进次级记忆(≤500 字);C/D 级标记低分,临时窗口(3 条)内豁免,之后按
"分数升序 → 时间线"驱逐 —— 低分轮次不会"刚说完就消失"; - 全量审计:每 6 轮触发一次,单次裸调用重评分、合并 critical(达 6 条时
重审淘汰过时约束)、重建记忆、按驱逐算法清理; - 持久化:
conversation.jsonl只写档案(完整记录)+context.jsonlast
可用上下文(退出重启后 resume 继续对话);默认可执行文件目录,可配~; /new命令:新建会话,清空可用上下文;- 可插拔:卸载 memory 插件 → chat 自动回退纯滑动窗口。
- 逐条后台评分:每条交互由模型打 1~5 分(S 约束/A 事实/B 一般/C 低/D 无意义),
- 工具回路(chat):模型需要查看文件/执行命令时输出
/fs、/run等命令,
本地执行后结果回灌,再基于真实结果作答(白名单:fs/run/pwd/mode); - Markdown 渲染:AI 回复按 Markdown 着色(标题/粗体/斜体/行内代码/代码块/
列表/引用/链接/转义),TUI 阅读体验提升; - 系统信息注入 base prompt:启动时收集 OS/主机/用户/工作目录/shell/CPU 等
注入系统提示词;Windows 上/run优先cmd /C,需 PowerShell 时显式写
powershell -Command ...。
构建产物
localai-v0.4.0-win-x64.zip—— Windows 10+ x64localai-v0.4.0-macos-aarch64.tar.gz/-x86_64.tar.gz—— macOSlocalai-v0.4.0-linux-x64.tar.gz—— Linux x64(CentOS 7+ 兼容,glibc 2.17)
使用要点
./localai # TUI(memory 插件默认加载)
"当前目录有什么文件" # 模型会自动 /fs ls 并基于真实结果回答
/new # 新建会话,清空可用上下文(记忆/历史)配置(localai.yml):
plugins:
- name: memory
options:
memory_max_chars: 500 # 次级记忆预算(字)
critical_max_items: 8 # 关键记忆条数上限(S 级,不计入预算)
trigger_turns: 6 # 每 6 轮全量审计一次
persist:
dir: "default" # "default"=可执行文件目录;"~"=家目录说明:对话档案实现为
conversation.jsonl(JSONL 追加,只写不读),与文档中的
conversation.json命名略有差异,语义一致。