作用:md中latex的正则替换【适合人类阅读】;重量级见:pdf2office-md-zip-pro# md在线编辑与pdf对比转换平台 功能:(1)md的latex符号自动清洗符号;(2)多zip查看与保存;(3)md转图片式pdf;优点:(1)镜像较小:1xxM;(2)去除转换docx和非图片式pdf的功能;
基于文档 ``` https://github.com/agno-agi/agno/tree/aa842b2bf7c446f1f9c63060a30610c63dd4901a/cookbook ``` 头脑风暴,文档和基于langchain和langgraph技术能到教程的最后能实现什么智能体。
笔记-searxng-网络搜索根据关键词获取URL(bing搜索10条结果);缺点-图片搜索:关键词多时的语义理解不好(基于自然语言的搜索不好,如搜天津能出,搜天津美食就什么也搜不到);
可直接通过docker或compose启动的项目;或者通过makefile/sh等进行自动化构建;windows上自动安装scoop-git-cmake等工具;
对md文件或md-zip中的图片相对路径或图片url解析多模态解析,将解析文字嵌入原位置;大模型(不思考):qwen3.5-4b-awq;文件变化:(1)zip/md->md;(2)zip->zip;
用vllm/vllm-openai镜像和docker compose启动的模型或项目;包括glm-ocr;LightOnOCR-2-1B;HY-MT1.5;mineru2.5-pro;qwen3.5;
轻量ocr的fastapi化;OpenDoc-0.1B(或unirec-0.1b)的gpu/cpu调用;基于镜像ayler/paddlepaddle-gpu-320-image;
基于translate-md-folder-by-llm-project;将其中的python都替代为go进行真多任务并发;模型基于Tencent-Hunyuan/Hy-MT2-1.8B-FP8;
新增pdf翻译(此项目原为md的zip的翻译) pdf的解析基于https://github.com/PDFMathTranslate-next/PDFMathTranslate-next 翻译接口调用自带的hy-mt;默认翻译模型:Tencent-Hunyuan/Hy-MT2-1.8B-FP8;
基于hy-mt-1.5翻译大模型的文件夹户或zip压缩包的markdown(md)递归翻译; hunyuan翻译大模型的sglang部署;
统一的 PDF 转换服务(非ocr式),支持:PDF → DOCX / XLSX (表格提取) / 图片(ZIP) / PPTX。缺点:gpl式证书(因为pymupdf等);
项目a2-image/pdf转高质量office/pdf/md-基于正则替换【ocr法】pdf或图片识别为office文件-基于paddleocr-vl-1.5【推荐】aylerh/pdf2office-md-zip-project功能:(1)pdf或图片->包含zip,pptx,docx,xlsx,PDF (图片式)和PDF (非图片式);(2)识别md的对比修改;优点:(1)一键启动
特色:文字替换(仅使用此功能即可):可替换文本式pdf内的内容;缺点:文字替换有残留痕迹;md转pdf:(1)默认不处理latex公式;(2)图片前后分段不对;(3)图片未导入;(4)表格转换不好;pdf提取md:
基于other2pdf-project。基于 Gotenberg转换(go);gin作为web框架和服务器;panjf2000/ants异步任务管理器;
转换任意文档或url链接为高质量pdf;基于 **Gotenberg**(后端)+ **FastAPI**(中间层/静态服务)+ **Vue3**(前端)