What's Changed
- fix(purejava): correct and scale GGUF inference by @bsbodden in #1
- feat(purejava): support mixed Q4_K_M models by @bsbodden in #2
- feat(purejava): support DeepSeek-Coder 6.7B by @bsbodden in #3
- feat(purejava): support MiniCPM5 1B by @bsbodden in #4
- feat(purejava): support Qwen3 8B by @bsbodden in #5
- feat(purejava): support DeepSeek R1 Distill Qwen 7B by @bsbodden in #6
- feat(purejava): support Qwen2.5 Math 1.5B by @bsbodden in #7
- feat(semantic-order): add pure Java WordTour models by @bsbodden in #8
- feat(purejava): support SQLCoder 7B Q5_K by @bsbodden in #9
- feat(purejava): support SmolLM3 inference by @bsbodden in #10
- feat(purejava): verify HuatuoGPT-o1 inference by @bsbodden in #12
- docs: add shared ModelJars branding by @bsbodden in #13
- docs(branding): use transparent ModelJars icons by @bsbodden in #14
- feat(bench): compare local inference backends by @bsbodden in #15
- perf(purejava): accelerate prompt and decode inference by @bsbodden in #16
- perf(purejava): group Q4_K transformer projections by @bsbodden in #17
- perf(purejava): group Q5_K transformer projections by @bsbodden in #18
- perf(purejava): group Q8 gate and up projections by @bsbodden in #19
- feat(bench): audit exact inference determinism by @bsbodden in #20
- feat(purejava): add speculative verification foundation by @bsbodden in #21
- feat(runtime): add adaptive n-gram speculative generation by @bsbodden in #22
- feat(purejava): enable Q4_K batched prefill by @bsbodden in #23
- feat(purejava): enable Q6_K batched prefill by @bsbodden in #24
- feat(purejava): enable Q5_K batched prefill by @bsbodden in #25
- perf(purejava): batch Q8_0 prefill by @bsbodden in #26
- feat(bench): report decode GC pressure by @bsbodden in #27
- docs(bench): refresh inference performance matrix by @bsbodden in #28
- feat(purejava): add deterministic execution planning by @bsbodden in #29
- perf(purejava): group mixed K-quant projections by @bsbodden in #30
- perf(purejava): group batched K-quant prefill by @bsbodden in #31
- perf(purejava): group batched Q4 projections by @bsbodden in #32
- perf(purejava): group batched Q8 gate projections by @bsbodden in #33
- perf(purejava): enable Q5_0 batched prefill by @bsbodden in #34
- perf(purejava): prune unused final-layer prompt rows by @bsbodden in #35
- perf(purejava): prune final-layer prompt attention by @bsbodden in #36
- feat(purejava): diagnose ModelJars launch profiles by @bsbodden in #37
- feat(purejava): apply model-scoped kernel profiles by @bsbodden in #38
- feat(bench): profile ModelJar-backed inference by @bsbodden in #39
- fix(bench): profile production decode positions by @bsbodden in #40
- refactor(purejava): remove equal-width KV compatibility API by @bsbodden in #41
- perf(purejava): batch attention value accumulation by @bsbodden in #42
- perf(purejava): batch exact attention scores by @bsbodden in #43
- perf(purejava): route unsigned Q4 kernel by @bsbodden in #44
- feat(bench): add isolated prefill profiler by @bsbodden in #45
- fix(purejava): align model profile expectations by @bsbodden in #46
- feat(purejava): stage Q4 feed-forward prefill by @bsbodden in #47
- docs(purejava): document staged Q4 planning by @bsbodden in #48
- perf(purejava): retain Q4 output and FFN stages by @bsbodden in #49
- perf(purejava): retain batched attention stages by @bsbodden in #50
- fix(purejava): report seven-stage Q4 layer plan by @bsbodden in #51
- fix(bench): repair controlled benchmark artifact handling by @bsbodden in #52
- perf(purejava): stage Q8 transformer layers by @bsbodden in #53
- docs(bench): record Q8 batch weight reuse by @bsbodden in #54
- perf(purejava): use block-major Q8 activations by @bsbodden in #55
- perf(purejava): parallelize Q8 FFN preparation by @bsbodden in #56
- perf(purejava): select row-accumulated Q8 kernel by @bsbodden in #57
- perf(purejava): select float-lane Q8 kernel by @bsbodden in #58
- feat(rag): benchmark profiled ModelJars runtimes by @bsbodden in #59
- feat(native): add Models-owned Rust inference kernels by @bsbodden in #60
- feat(native): accelerate Q8_0 projections by @bsbodden in #61
- feat(rag): qualify native model workloads by @bsbodden in #62
- feat(native): expand quantized qualification coverage by @bsbodden in #63
- feat(purejava): qualify EuroLLM and Fin-R1 by @bsbodden in #64
- feat(rag): add vertical qualification and ModelJar profiles by @bsbodden in #65
- feat(rag): add native model prompt templates by @bsbodden in #66
- perf(native): reuse K-quant weights across prompt batches by @bsbodden in #67
- perf(native): reduce Q4_K batch SIMD reductions by @bsbodden in #68
- test(rag): qualify DeepSeek R1 Distill Qwen 1.5B by @bsbodden in #69
- feat(rag): qualify Qwen2.5 Math 1.5B by @bsbodden in #70
- test(rag): qualify Llama 3.2 3B by @bsbodden in #71
- feat(rag): qualify DeepSeek-Coder 1.3B by @bsbodden in #72
- test(rag): qualify SmolLM3 3B by @bsbodden in #73
- feat(rag): qualify TinyLlama 1.1B by @bsbodden in #74
- feat(rag): qualify final launch models by @bsbodden in #75
- feat!: finalize Models 0.1.0 public surface by @bsbodden in #76
- fix(docs): checkout ModelJars for deployment by @bsbodden in #77
- chore(release): prepare models 0.1.0 by @bsbodden in #78
- fix(release): avoid duplicate host native artifact by @bsbodden in #79
- chore(deps): update Vectors to 0.1.2 by @bsbodden in #80
New Contributors
Full Changelog: https://github.com/integrallis/models/commits/v0.1.0