Skip to content

v0.12.8

Choose a tag to compare

@sauravpanda sauravpanda released this 19 May 19:17
931cc24

Summary

  • Reduce Gemini screenshot/media token cost by defaulting ChatGoogle media inputs to low resolution.
  • Honor Agent(..., vision_detail_level=...) by forwarding it to providers with media-resolution support.
  • Honor images_per_step=0 by omitting screenshot image parts from LLM prompts while keeping DOM state.
  • Add modality token details to usage logs and ChatInvokeUsage.model_dump() for image/text cost attribution.

Verification

  • .venv/bin/python -m unittest discover -s tests -q
  • .venv/bin/python -m compileall -q python/browser_use_rs tests bench
  • cargo check -p bu-py
  • cargo test -p bu-cdp -p bu-dom -p bu-browser
  • BROWSER_USE_RS_DISABLE_DOTENV=1 .venv/bin/python bench/release_preflight.py
  • git diff --check