Skip to content

Releases: integrallis/models

Release list

models 0.1.0

Choose a tag to compare

@github-actions github-actions released this 29 Jul 17:36
62ca612

What's Changed

  • fix(purejava): correct and scale GGUF inference by @bsbodden in #1
  • feat(purejava): support mixed Q4_K_M models by @bsbodden in #2
  • feat(purejava): support DeepSeek-Coder 6.7B by @bsbodden in #3
  • feat(purejava): support MiniCPM5 1B by @bsbodden in #4
  • feat(purejava): support Qwen3 8B by @bsbodden in #5
  • feat(purejava): support DeepSeek R1 Distill Qwen 7B by @bsbodden in #6
  • feat(purejava): support Qwen2.5 Math 1.5B by @bsbodden in #7
  • feat(semantic-order): add pure Java WordTour models by @bsbodden in #8
  • feat(purejava): support SQLCoder 7B Q5_K by @bsbodden in #9
  • feat(purejava): support SmolLM3 inference by @bsbodden in #10
  • feat(purejava): verify HuatuoGPT-o1 inference by @bsbodden in #12
  • docs: add shared ModelJars branding by @bsbodden in #13
  • docs(branding): use transparent ModelJars icons by @bsbodden in #14
  • feat(bench): compare local inference backends by @bsbodden in #15
  • perf(purejava): accelerate prompt and decode inference by @bsbodden in #16
  • perf(purejava): group Q4_K transformer projections by @bsbodden in #17
  • perf(purejava): group Q5_K transformer projections by @bsbodden in #18
  • perf(purejava): group Q8 gate and up projections by @bsbodden in #19
  • feat(bench): audit exact inference determinism by @bsbodden in #20
  • feat(purejava): add speculative verification foundation by @bsbodden in #21
  • feat(runtime): add adaptive n-gram speculative generation by @bsbodden in #22
  • feat(purejava): enable Q4_K batched prefill by @bsbodden in #23
  • feat(purejava): enable Q6_K batched prefill by @bsbodden in #24
  • feat(purejava): enable Q5_K batched prefill by @bsbodden in #25
  • perf(purejava): batch Q8_0 prefill by @bsbodden in #26
  • feat(bench): report decode GC pressure by @bsbodden in #27
  • docs(bench): refresh inference performance matrix by @bsbodden in #28
  • feat(purejava): add deterministic execution planning by @bsbodden in #29
  • perf(purejava): group mixed K-quant projections by @bsbodden in #30
  • perf(purejava): group batched K-quant prefill by @bsbodden in #31
  • perf(purejava): group batched Q4 projections by @bsbodden in #32
  • perf(purejava): group batched Q8 gate projections by @bsbodden in #33
  • perf(purejava): enable Q5_0 batched prefill by @bsbodden in #34
  • perf(purejava): prune unused final-layer prompt rows by @bsbodden in #35
  • perf(purejava): prune final-layer prompt attention by @bsbodden in #36
  • feat(purejava): diagnose ModelJars launch profiles by @bsbodden in #37
  • feat(purejava): apply model-scoped kernel profiles by @bsbodden in #38
  • feat(bench): profile ModelJar-backed inference by @bsbodden in #39
  • fix(bench): profile production decode positions by @bsbodden in #40
  • refactor(purejava): remove equal-width KV compatibility API by @bsbodden in #41
  • perf(purejava): batch attention value accumulation by @bsbodden in #42
  • perf(purejava): batch exact attention scores by @bsbodden in #43
  • perf(purejava): route unsigned Q4 kernel by @bsbodden in #44
  • feat(bench): add isolated prefill profiler by @bsbodden in #45
  • fix(purejava): align model profile expectations by @bsbodden in #46
  • feat(purejava): stage Q4 feed-forward prefill by @bsbodden in #47
  • docs(purejava): document staged Q4 planning by @bsbodden in #48
  • perf(purejava): retain Q4 output and FFN stages by @bsbodden in #49
  • perf(purejava): retain batched attention stages by @bsbodden in #50
  • fix(purejava): report seven-stage Q4 layer plan by @bsbodden in #51
  • fix(bench): repair controlled benchmark artifact handling by @bsbodden in #52
  • perf(purejava): stage Q8 transformer layers by @bsbodden in #53
  • docs(bench): record Q8 batch weight reuse by @bsbodden in #54
  • perf(purejava): use block-major Q8 activations by @bsbodden in #55
  • perf(purejava): parallelize Q8 FFN preparation by @bsbodden in #56
  • perf(purejava): select row-accumulated Q8 kernel by @bsbodden in #57
  • perf(purejava): select float-lane Q8 kernel by @bsbodden in #58
  • feat(rag): benchmark profiled ModelJars runtimes by @bsbodden in #59
  • feat(native): add Models-owned Rust inference kernels by @bsbodden in #60
  • feat(native): accelerate Q8_0 projections by @bsbodden in #61
  • feat(rag): qualify native model workloads by @bsbodden in #62
  • feat(native): expand quantized qualification coverage by @bsbodden in #63
  • feat(purejava): qualify EuroLLM and Fin-R1 by @bsbodden in #64
  • feat(rag): add vertical qualification and ModelJar profiles by @bsbodden in #65
  • feat(rag): add native model prompt templates by @bsbodden in #66
  • perf(native): reuse K-quant weights across prompt batches by @bsbodden in #67
  • perf(native): reduce Q4_K batch SIMD reductions by @bsbodden in #68
  • test(rag): qualify DeepSeek R1 Distill Qwen 1.5B by @bsbodden in #69
  • feat(rag): qualify Qwen2.5 Math 1.5B by @bsbodden in #70
  • test(rag): qualify Llama 3.2 3B by @bsbodden in #71
  • feat(rag): qualify DeepSeek-Coder 1.3B by @bsbodden in #72
  • test(rag): qualify SmolLM3 3B by @bsbodden in #73
  • feat(rag): qualify TinyLlama 1.1B by @bsbodden in #74
  • feat(rag): qualify final launch models by @bsbodden in #75
  • feat!: finalize Models 0.1.0 public surface by @bsbodden in #76
  • fix(docs): checkout ModelJars for deployment by @bsbodden in #77
  • chore(release): prepare models 0.1.0 by @bsbodden in #78
  • fix(release): avoid duplicate host native artifact by @bsbodden in #79
  • chore(deps): update Vectors to 0.1.2 by @bsbodden in #80

New Contributors

Full Changelog: https://github.com/integrallis/models/commits/v0.1.0