找到
1
篇与
离线OCR
相关的结果
-
eSearch v15.3.3 免费开源版 集成离线 OCR 与公式识别的识屏搜索神器 15.3.3 - Windows eSearch 简介 在桌面级人机交互(HCI)范畴中,“屏幕”是信息呈现的最核心载体。然而,原生操作系统往往缺乏对屏幕位图(Bitmap)内容的深度结构化解析能力(如提取无法复制的文本、识别数学公式或根据像素逆向搜索)。为了构建一套无缝接入的屏幕数据提取管线,开源社区打造了《eSearch》。这款全能识屏工具在 v15.3.3 版本中,展示了极其优秀的前端矢量渲染与本地人工智能推演框架。 核心功能与技术解析 基于 Fabric.js 的高阶矢量图层控制:软件的截图画板放弃了简陋的位图绘制,转而引入了基于 HTML5 Canvas 的 Fabric.js 矢量图形库。每个标注箭头、矩形选框与高亮涂鸦均作为独立的矢量对象(Vector Objects)存在,支持二次缩放、旋转与属性修改,且能直接序列化导出为 SVG 矢量格式。同时集成了局部马赛克(Mosaic)与高斯模糊等卷积滤镜。 解耦的轻量化离线 OCR 推理引擎(eSearch-OCR):在文字与公式识别层,软件提供了完全本地化的解耦架构。利用 C++ / Python 编译的嵌入式 OCR 模型,能够在数十毫秒内完成区域文本定位(Text Detection)与字符分类(Text Recognition)。同时支持解析复杂的 LaTeX 数学公式,并自动剔除回车换行符,实现了排版级的格式清洗。 多层级置顶与透明度穿透控制:贴图(Pin)功能利用了 Win32 / X11 底层的窗口分层样式(WS_EX_LAYERED / WS_EX_TRANSPARENT),不仅支持基于鼠标滚轮的物理缩放与透明度调节,还支持极客最爱的“鼠标穿透”模式,使置顶图像完全不干扰下层窗口的键盘与鼠标输入。 多管道划词搜索与自动翻译:框选或划词后,软件能够并行触发多条异步 Worker 线程,将提取的文本流直接推送至内嵌浏览器或系统默认浏览器,完成多引擎搜索、以图搜图(Reverse Image Search)以及神经机器翻译(NMT)。 版本优化 (v15.3.3 开源便携版) 便携化的全本地配置保存:此版本经过便携化打包,所有的快捷键绑死、OCR 本地模型字典及自定义搜索引擎列表全部分离存储在本地程序目录下。无注册表依赖,不强制联网,隐私保护能力极强。 常见问题 问题: 为什么在提取某些英文论文时,识别出来的文字中间总是带有不必要的换行符(Line Breaks),导致复制到 Word 里的格式全乱了? 解决: 这是一个在 PDF 或网页排版中极其普遍的文本流切分现象。eSearch 内置了专门的排版清洗逻辑。只需在设置中勾选 “识别展示自动删除换行” 选项,或者利用其内置的【查找替换(支持正则表达式)】功能,软件就会在 OCR 完成后自动将段落内部的孤立换行符替换为空格,完美保留段落连续性。 体验总结 《eSearch v15.3.3 绿色版》是现代开源工具中极具集大成者色彩的黑科技产物。它用极其流畅的交互,将截图、贴图、OCR、公式识别与搜索翻译整合在了一个热键之下。在离线神经网络与矢量画布的加持下,它不仅大幅提升了文档与代码处理效率,更为所有追求极致生产力的极客打造了一把无所不能的“屏幕万能钥匙”。 演示截图 资源下载地址 百度网盘夸克网盘