Commit graph

1120 commits

Author SHA1 Message Date
Yiorgis Gozadinos
be715dd456
Revert docling core back to 1.8.0 for compatibility with docling-serve 2026-01-11 09:23:19 +02:00
Yiorgis Gozadinos
afc5b02285
Update schema to store docling_document as compressed bytes
- Change DocumentRecord.docling_document_json (str) to docling_document (bytes)
- Use large_binary Arrow type (64-bit offsets) to avoid 2GB column limit
- Decompress in Document.get_docling_document() using gzip
- Update DocumentRepository field mappings
2026-01-10 15:17:27 +02:00
Yiorgis Gozadinos
face6f95bc
compression utils 2026-01-10 15:11:58 +02:00
Yiorgis Gozadinos
09acc845c0
Update docling, docling-core, lancedb deps 2026-01-10 15:06:56 +02:00
Yiorgis Gozadinos
ff1f19bb08
vb 2026-01-08 18:50:39 +02:00
Yiorgis Gozadinos
bd1ea4e8a2
Merge pull request #222 from ggozad/fix/image-in-chunks
Fix base64 images leaking into expanded search results
2026-01-08 18:49:32 +02:00
Yiorgis Gozadinos
3603b00513
Fix base64 images leaking into expanded search results
PictureItem.export_to_markdown() defaults to ImageRefMode.EMBEDDED,
which embeds base64 image data. When _extract_item_text() called this
method during context expansion, base64 data would leak into results.

Now explicitly handles PictureItem with ImageRefMode.PLACEHOLDER to
prevent base64 while still including VLM descriptions and captions.
2026-01-08 18:42:58 +02:00
Yiorgis Gozadinos
4cae2cf26a
Clarify docs about using a VLM with docling-serve 2026-01-08 10:57:52 +02:00
Yiorgis Gozadinos
92f0fd956f
vb 2026-01-08 10:25:25 +02:00
Yiorgis Gozadinos
af380c8e52
Merge pull request #220 from ggozad/fix/openai-non-reasoning-model
Fix non-reasoning OpenAI models that do not support reasoning config
2026-01-08 10:18:50 +02:00
Yiorgis Gozadinos
1616891c40
Fix non-reasoning OpenAI models that do not support reasoning config 2026-01-07 18:47:31 +02:00
Yiorgis Gozadinos
ef187767ed
vb 2026-01-07 11:20:48 +02:00
Yiorgis Gozadinos
8939b8a313
Merge pull request #218 from ggozad/feat/vlm-image-handling
Support for VLM-based picture description for embedded images
2026-01-07 11:18:23 +02:00
Yiorgis Gozadinos
2f413e937b
Add VLM model to download_models() 2026-01-07 11:09:24 +02:00
Yiorgis Gozadinos
248eed8d7b
Update docs 2026-01-07 11:09:23 +02:00
Yiorgis Gozadinos
f861664656
Extract shared DoclingServeClient for async workflow & use it for VLM support, chunking, converting 2026-01-07 11:09:23 +02:00
Yiorgis Gozadinos
3b7fd440cc
End-to-end test for VLM annotation 2026-01-07 11:09:23 +02:00
Yiorgis Gozadinos
769e0d4746
Update picture description prompt, move its config under prompts 2026-01-07 11:09:23 +02:00
Yiorgis Gozadinos
3c4116397d
Add VLM picture description support for image handling 2026-01-07 11:09:22 +02:00
Yiorgis Gozadinos
9bf3a83b5d
Fix typo 2026-01-05 16:39:36 +02:00
Yiorgis Gozadinos
af340ac410
vb 2026-01-05 12:15:41 +02:00
Yiorgis Gozadinos
dc9a99e8f5
Merge pull request #217 from ggozad/chore/dependencies
Update dependencies
2026-01-05 12:12:43 +02:00
Yiorgis Gozadinos
ff58adb549
Update ag-ui-research example 2026-01-05 12:04:30 +02:00
Yiorgis Gozadinos
7ddd29d108
Update a2a example 2026-01-05 11:53:30 +02:00
Yiorgis Gozadinos
271af6cb3c
Update core dependencies 2026-01-05 11:52:38 +02:00
Yiorgis Gozadinos
d4ff1febbc
Merge pull request #216 from ggozad/fix/concurrent-search-emitter
Fix concurrent step tracking in AG-UI emitter
2026-01-05 11:15:36 +02:00
Yiorgis Gozadinos
5b34b9ed0e
Track potentially more than one running step in agui emitter 2026-01-05 10:41:35 +02:00
Yiorgis Gozadinos
c4b1733339
vb 2025-12-29 18:45:06 +02:00
Yiorgis Gozadinos
679d0bfafd
Merge pull request #212 from ggozad/feat/contextualize-fts
Add additional context (headers/sections etc) to the FTS index
2025-12-29 18:42:19 +02:00
Yiorgis Gozadinos
1dc40abab3
get_reranker() tests 2025-12-29 17:13:14 +02:00
Yiorgis Gozadinos
22f22d2181
Add vcr to tests 2025-12-29 14:59:15 +02:00
Yiorgis Gozadinos
a4d33c9e71
Delete test_agui_server.py, it was accidentally commited 2025-12-29 14:58:04 +02:00
Yiorgis Gozadinos
fc3530258d
cl 2025-12-29 14:50:59 +02:00
Yiorgis Gozadinos
c9cb005d07
Use FTS on contextualized text 2025-12-29 14:50:07 +02:00
Yiorgis Gozadinos
02f5dc4fb9
Merge pull request #210 from ggozad/feat/tests-vcr
VCR Cassette Recording for API-less tests.
2025-12-29 14:42:31 +02:00
Yiorgis Gozadinos
68ac50acff
Add coverage and badges 2025-12-29 14:36:01 +02:00
Yiorgis Gozadinos
1609582c1f
Move cassettes to default location, add development.md to docs 2025-12-29 14:13:25 +02:00
Yiorgis Gozadinos
bfae711a17
Do not run test requiring docling OCR in CI 2025-12-29 13:44:57 +02:00
Yiorgis Gozadinos
1e9a10a235
Record cassettes for embedder, ignore huggingface while recording 2025-12-29 13:23:53 +02:00
Yiorgis Gozadinos
5844d07c5d
Add lint github action 2025-12-27 18:50:57 +02:00
Yiorgis Gozadinos
b64a2b08ee
Commit dataset for CI and github workflow 2025-12-26 19:30:26 +02:00
Yiorgis Gozadinos
0da8ba97c4
Docling-serve cassettes 2025-12-26 18:59:46 +02:00
Yiorgis Gozadinos
c3a3b4a5b4
Extended VCR cassette recording to embedder, client, research graph, and search filter tests 2025-12-26 18:53:17 +02:00
Yiorgis Gozadinos
4a82e47d03
Use cassette to record and reply llms in qa tests 2025-12-26 15:41:11 +02:00
Yiorgis Gozadinos
1f654917b8
vb 2025-12-26 13:56:29 +02:00
Yiorgis Gozadinos
e9657c2044
Merge pull request #207 from ggozad/feat/prompt-overrides
Add prompt customization and domain preable
2025-12-26 13:36:07 +02:00
Yiorgis Gozadinos
08fb99c6f8
Add prompt customization and domain preable 2025-12-26 13:34:51 +02:00
Yiorgis Gozadinos
c44ebcd371
Merge pull request #209 from ggozad/feat/pydantic-ai-embeddings
Use Pydantic AI embeddings
2025-12-26 13:32:30 +02:00
Yiorgis Gozadinos
958fe43f2a
Remove vllm and lmstudio custom configs, they can now use the openai base 2025-12-26 12:02:55 +02:00
Yiorgis Gozadinos
d4861b6408
Docs & changelog 2025-12-26 11:57:27 +02:00