看到纸上的文章、课本页面、演讲截图或手机里的图片时,不需要先手动把文字敲出来。听点点可以从图片中识别文字,把结果放进文字输入流程;校对后直接生成可学习的音频和字幕。
打开听点点首页,在导入面板里找到入口:
也可以从首页的「更多」导入入口进入。
常见图片格式都可以使用,包括:
jpg、jpeg、png、heic、heif、webp、bmp、gif、tiff、tif
单张图片不能超过 10 MB。如果原图太大,可以先裁剪或压缩后再识别。
手机端可以直接拍一页纸,也可以从相册选择已有照片。桌面端可以选择截图、下载的图片或扫描件。
如果一次选择多张图片,每张图片会作为一页进入识别页面,顶部会显示缩略图,方便切换和调整顺序。
识别页面会让你选择识别方式:
一次导入中,后面新增的图片会沿用当前的识别语言设置,不会每张都重新询问。
识别结果会逐步出现在文本框里。完成后可以直接编辑:修正错别字、删除页眉页脚、补回漏掉的词,或者调整段落。
识别页面还支持:
点缩略图列表末尾的「+」可以继续添加图片。确认每一页文字后,点右上角「下一步」,听点点会按页面顺序合并文字,并带到「文字输入」页面。
在那里还可以继续编辑,最后点「预览」生成可学习的内容。
识别结果为空怎么办?
确认图片里有清晰可见的文字,并检查图片没有超过 10 MB。也可以重新拍摄、换一张图片,或用「框选重识别」缩小识别范围。
一张图片里有中英文,能不能只保留英文?
可以。在识别语言里选择目标语言,听点点会只把该语言的文字放进结果。想保留整页内容时选择「完整识别」。
图片识别完成后,文字保存在哪里?
点「下一步」后,文字会进入文字输入页面。你可以在那里继续修改,预览并生成内容。