...常需要创建并分享各种报表，其中最常见的就是将报表导出为Excel格式以便于与他人共享。嘿，你知道吗？有时候啊，我们可能会遇到这么个情况：明明数据已经乖乖地、一点没错地被塞进了Excel表格里头，可那个本来整整齐齐的报表格式呢，却像被调皮的小孩一键清空了似的，彻彻底底消失不见了！这让我们非常困惑，因为我们明明在 Saiku 中设置了报表的样式。那么，究竟是什么原因导致了这种情况呢？本文将以“Saiku 报表导出为 Excel 格式时为何丢失样式设置？”为主题，进行详细的探讨和解答。二、原因分析为了更好地理解这个问题，我们需要先从基本概念入手。报表的样子，主要是由Saiku这个家伙提供的CSS样式类在背后操控的，这些样式类就像魔法师一样，通过JavaScript这门神秘的语言，灵活地给报表的各种元素穿上不同的“外衣”。当我们将报表导出为 Excel 时，由于 Excel 并不支持动态加载的 CSS 类，所以这些类会丢失，从而导致样式被删除。三、解决方法既然知道了问题的原因，那么如何解决它呢？下面我们将介绍几种可能的方法： 3.1 方法一：使用 Saiku 的导出功能 Saiku 自带了一个名为“Export to Excel”的功能，可以方便地将报表导出为 Excel 文件。在这一整个过程中，Saiku这家伙可机灵了，它会主动帮咱们把所有和样式有关的小细节都给妥妥地搞定，这样一来，我们就完全不必为丢失样式的问题而头疼啦！以下是使用 Saiku 导出报表的代码示例： javascript saiku.model.exportToXLSX(); 这个函数会直接将当前报表导出为一个名为“report.xlsx”的 Excel 文件，文件中包含了所有的数据和样式。 3.2 方法二：手动修改 Excel 文件如果我们必须使用 Excel 进行导出，那么我们可以尝试手动修改 Excel 文件，使其包含正确的样式信息。以下是一个简单的示例，展示了如何通过 VBA 宏来修复样式丢失的问题： vba Sub FixStyle() ' 找到所有丢失样式的单元格 Dim rng As Range Set rng = ActiveSheet.UsedRange For Each cell In rng If cell.Font.Bold Then cell.Font.Bold = False End If If cell.Font.Italic Then cell.Font.Italic = False End If ' 添加其他样式... Next cell End Sub 这段代码会在 Excel 中遍历所有已使用的单元格，然后检查它们是否缺少某些样式。如果发现了缺失的样式，那么就将其添加回来。四、结论总的来说，Saiku 报表导出为 Excel 格式时丢失样式设置，主要是因为 Excel 不支持动态加载的 CSS 类。不过呢，咱其实有办法解决这个问题的。要么试试看用 Saiku 的那个导出功能，它能帮上忙；要么就亲自操刀，手动修改一下 Excel 文件，这样也行得通。这两种方法各有优缺点，具体选择哪种方法取决于我们的需求和实际情况。

2023-10-07 10:17:51

繁华落尽-t

Saiku

Saiku中处理日期格式不匹配问题：Dimension Field的设置与内置转换功能应用实例

...理与转换不仅仅局限于Saiku这一工具。事实上，许多其他流行的数据分析和商业智能软件如Tableau、Power BI和Excel等也都提供了强大的日期格式自定义功能。例如，Excel中的“TEXT”函数可以将日期格式转换为用户所需的任何样式，而Tableau则允许用户在数据源或工作表级别调整日期格式以满足不同可视化需求。近期，随着大数据和实时分析需求的增长，正确处理日期时间格式的重要性愈发凸显。2021年，Apache Druid宣布对其日期时间处理引擎进行了重大升级，大幅提升了对复杂日期格式的支持以及跨时区查询性能，这充分体现了业界对于精确日期时间管理的高度重视。此外，在进行跨国或跨地区数据分析时，还需考虑国际日期格式差异及各地区的日期习惯。例如，美国通常使用“MM/dd/yyyy”，而在欧洲许多国家则倾向于“dd/MM/yyyy”。因此，掌握并灵活应用各种工具进行日期格式转换，是现代数据分析师必备的重要技能之一。深入理解日期格式的标准化和规范化不仅有助于提高数据分析效率，还能有效避免因日期误解而导致的重大决策失误。对于企业而言，建立统一的日期格式标准并确保其在各类系统和工具中的一致性，已成为提升数据治理水平的关键一环。

2023-08-28 23:56:56

柳暗花明又一村-t

Saiku

Saiku报表工具实战：从安装配置到数据可视化分析及高级设置详解

一、引言报表是企业日常工作中不可或缺的一部分，它能帮助我们了解业务运行情况，发现潜在问题，并制定有效的解决方案。而在众多报表工具中，Saiku无疑是一个不错的选择。它的易用性和灵活性使其在业界受到了广泛的好评。那么， Saiku的报表功能究竟如何使用呢？今天，我们就来一起探索一下。二、什么是Saiku 首先，让我们简单了解一下什么是Saiku。Saiku是一款开源的数据可视化和分析工具，它可以轻松地与各种数据源进行集成，如Excel、Hive、Oracle等，从而提供强大的报表功能。Saiku拥有的用户界面超级友好，就算你是个编程零基础的小白，也能轻松玩转它，快速上手没压力！三、安装与配置接下来，我们将介绍如何安装和配置Saiku。以下是详细的步骤： 1. 在你的计算机上下载并安装Java开发环境（JDK）。 2. 下载并解压Saiku的最新版本。 3. 打开解压后的文件夹，找到bin目录下的start.bat文件双击运行。 4. 这时，你应该能看到一个Web浏览器自动打开，访问http://localhost:8080/saiku。 5. 点击"Login"按钮，然后输入默认用户名和密码（均为saiku）。恭喜你！你现在已经在Saiku的环境中了。四、创建报表现在，我们来创建一个简单的报表。以下是一步步的操作指南： 1. 首先，点击左侧菜单栏的"Connection Manager"，添加你需要的数据源。 2. 接下来，回到主界面，点击上方的"New Dashboard"按钮，创建一个新的仪表板。 3. 在弹出的新窗口中，你可以看到一个预览窗口。在这里，你可以通过拖拽的方式来选择需要展示的数据字段。 4. 当你选择了所有需要的字段后，可以点击右下角的"Add to Dashboard"按钮将其添加到你的仪表板上。 5. 最后，点击右上角的"Save Dashboard"按钮，保存你的工作。现在，你已经成功地创建了一个新的报表！五、高级设置除了基本的报表创建功能外，Saiku还提供了许多高级设置，让你能够更好地定制你的报表。比如说，你完全可以按照自己的想法，通过更换图表样式、挑选不同的颜色搭配方案，或者调整布局结构等方式，让报表的视觉效果焕然一新。就像是给报表精心打扮一番，让它看起来更加吸引人，更符合你的个性化需求。此外，你还可以通过编写SQL查询来获取特定的数据。这些高级设置使得Saiku成为一个真正的强大工具。六、总结总的来说，Saiku的报表功能非常强大，无论是初学者还是专业人员都能从中受益。虽然最开始学起来可能有点费劲，感觉像是在爬一座小陡山，但只要你舍得花点时间，下点功夫，我打包票，你绝对能玩转这个工具的所有功能，把它摸得门儿清。所以，如果你现在还在为找不到一个给力的报表工具头疼不已，那我真的建议你试一试Saiku这个神器！我跟你保证，它绝对会让你眼前一亮，大呼惊喜！七、问答环节下面是我们收集的一些常见问题以及解答：问：我在创建报表时遇到了困难，怎么办？答：首先，你可以查阅Saiku的官方文档或者在网上搜索相关的教程。如果这些都无法解决问题，你也可以在Saiku的论坛上寻求帮助。社区里的其他用户都非常热心，他们一定能够帮你解决问题。问：我能否自定义报表的颜色和样式？答：当然可以！Saiku提供了丰富的自定义选项，包括颜色方案、字体、布局方式等。你只需点击相应的按钮，就可以开始自定义了。问：我可以将报表导出吗？答：当然可以！你可以将报表导出为PDF、PNG、SVG等多种格式，以便于分享或者打印。

2023-02-10 13:43:51

119

幽谷听泉-t

转载文章

[转载]Java Work

...符串转对象 EasyExcel 官方API https://www.yuque.com/easyexcel/doc 使用类注解@ExcelIgnoreUnannotated配合@ExcelProperty操作 @ExcelProperty可以指定表头列名，列顺序和表头的合并 @ColumnWidth(10)可以指定列宽，其长度约为(中文length3+英文length1) @DateTimeFormat(value="yyyy-MM-dd HH:mm:ss")可以指定日期格式自定义策略实现SheetWriteHandler工作表回调接口，在afterSheetCreate()工作表创建之后方法可以设置列宽自定义表头新建单元格自定义策略实现RowWriteHandler行回调接口，在afterRowDispose()行操作完之后方法可以设置行高设置行样式自定义策略实现CustomerCellHandler单元格回调接口，在afterCellDispose()单元格操作完之后方法可以根据行号，列宽甚至是单元格的值来设置单元格样式可以对单元格的值获取和修改样式通常包括内容格式、批注、背景色、自动换行、平和垂直居中、边框大小和颜色、字体实例（格式，颜色，大小，加粗等）等自定义策略继承AbstractMergeStrategy单元格合并抽象类，在merge()方法中可以通过CellRangeAddress合并单元格过于复杂的表格可以使用模板，配合写出write和填充fill一起使用 Mybatis 在mapper方法的@select中也是可以直接书写动态SQL的，但要使用<script></script>包裹，这样就不用在java文件和xml文件切换了，将@select中包裹的代码直接放到浏览器的控制台输出后会自动转义\n,\t,+,"等动态sql中“<” 和 “>” 号要用转义字符 “<” 和 ”>“ （分号要带）动态sql中test中表达式通常使用 test=“id != null and id != ‘’”，要注意的是字符串不能直接识别单引号，有两种方法使用id==“1001"或者id==‘1001’.toString()，另外参数如果是boolean，可以直接使用test=”!flag"，如果判定集合的话可以使用 test=“list != null and list.size>0” 返回数据类型为Map只能接收一条记录，字段为键名，字段值为值，但通常是用实体类接收，或是使用注解@MapKey来进行每条记录的映射，效果等同于List用Stream流转Map foreach遍历list collection=“list” item=“vo” separator="," open="(" close=")"> {vo.id} foreach遍历map collection=“map” index=“key” item=“value”，{key}获取建，{value}获取值，$亦可 collection=“map.entrySet()” index=“key” item=“value”，同上 collection=“map.keys” item=“key”，{key}为键不要使用where 1=1，使用动态where拼接，会自动剔除where后多余的and和or 单个参数时无论基本和引用并且未使用在动态SQL可以不加参数注解@Param，但一旦参数大于一个或者参数在动态SQL中使用就必须加@Param 并不是直接把参数加引号，而是变成?的形式交给prepareStatement处理，$直接使用值，当ORDER BY诸如此类不需要加引号的参数时，使用$代替，但为避免sql注入，该参数不能交由用户控制 Plus 官方API https://baomidou.com/guide/ @TableName 表名 @TableField(strategy = FieldStrategy.IGNORED) 更新不会忽略NULL值 @TableField(exist = false)表明该字段非数据字段，否则新增更新会报错 MybatisPlus对于单表的操作还是非常优秀的，在对单表进行新增或者更新的时候经常使用，但对于单表的查询业务上很少出现仅仅查询一张表的情况，但也会有，如果条件不大于3个还是可以使用的，多了倒没有直接写SQL来的方便了 MybatisPlus的批量插入也是通过for循环插入的，还是建议使用Mybatis的动态foreach进行批量插入 MybatisPlus的分页器会对方法中的参数判断，如果存在分页对象就先查询总数看是否大于0，然后拼接当前的数据库limit语句，所以如果我们分页对象为null，就可以实现不分页查询 Object paramObj = boundSql.getParameterObject();IPage page = null;if (paramObj instanceof IPage) { ……public static String getOriginalCountSql(String originalSql) {return String.format("SELECT COUNT(1) FROM ( %s ) TOTAL", originalSql);} ……originalSql = DialectFactory.buildPaginationSql(page, buildSql, dbType, this.dialectClazz); ……public String buildPaginationSql(String originalSql, long offset, long limit) {StringBuilder sql = new StringBuilder(originalSql);sql.append(" LIMIT ").append(offset).append(",").append(limit);return sql.toString();} IDEA 插件 Lombok : 快速生成getter、setter等 Alibaba Java Coding Guidelines ：阿里规约扫描 Rainbow Brackets ：彩色括号 HighlightBracketPair ：高亮提示 MyBatisX ：mabatisPlus提供的xml和mapper转换的插件，小鸟图标 CamelCase ：大小写、驼峰、下划线、中划线转换插件使用shift+Alt+u进行转换（很方便）可以在Editor中设置CamelCase的转换，一般只保留下划线和驼峰两种 String Manipulation ：字符串工具（未使用） RestfulToolkit http ：Restful请求工具打开idea，在右侧边栏会有一个标签（RestServices），打开可以看到里面是url路径 ctrl+\或者ctrl+alt+n会检索路径 Ctrl + Enter格式化json 没有记忆功能，也不能加token，只是查找请求路径使用 easycode ：代码生成工具（个人觉得很好用，常用于生成实体类）支持自定义模板支持添加自定义列，不影响数据库支持多表同时生成支持自定义类型映射支持配置导入导出支持动态调试支持自定义属性 Power Mode 11 ：打字特效（纯属装逼） Nyan Progress Bar ：漂亮的进度条（纯属装逼） Other Vo：数据持久化模型 Query：数据查询模型 Dto：数据传输模型本篇文章为转载内容。原文链接：https://blog.csdn.net/qq_40910781/article/details/111416185。该文由互联网用户投稿提供，文中观点代表作者本人意见，并不代表本站的立场。作为信息平台，本站仅提供文章转载服务，并不拥有其所有权，也不对文章内容的真实性、准确性和合法性承担责任。如发现本文存在侵权、违法、违规或事实不符的情况，请及时联系我们，我们将第一时间进行核实并删除相应内容。

2023-05-26 23:30:52

268

转载

JQuery插件下载

炫酷Bootstrap美化Tabs选项卡特效

...制和增强，利用CSS样式技术为其添加了独特的伸缩动画效果，使得标签页在切换时展现出更加生动活泼且专业的界面过渡。通过引入这款插件，开发者能够轻松实现动态、流畅的选项卡交互体验，不仅保留了BootstrapTabs原有的简洁易用性，更赋予其引人注目的视觉吸引力。只需在HTML页面中正确引入Bootstrap相关文件以及jQuery库，并按照插件提供的简单结构和使用方法配置，即可快速将原本静态的标签页转变为拥有丰富动画特效的炫酷选项卡布局。总之，“炫酷Bootstrap美化Tabs选项卡特效”是一个实用且美观的解决方案，可无缝集成到基于Bootstrap构建的项目中，帮助开发者在不牺牲性能的前提下，以较低的成本为网站或应用增添一抹时尚且专业的用户界面亮点。点我下载文件大小：41.96 KB 您将下载一个JQuery插件资源包，该资源包内部文件的目录结构如下：本网站提供JQuery插件下载功能，旨在帮助广大用户在工作学习中提升效率、节约时间。本网站的下载内容来自于互联网。如您发现任何侵犯您权益的内容，请立即告知我们，我们将迅速响应并删除相关内容。免责声明：站内所有资源仅供个人学习研究及参考之用，严禁将这些资源应用于商业场景。若擅自商用导致的一切后果，由使用者承担责任。

2023-07-28 09:56:58

268

本站

HTML

光头强代码html

...文本。使用元素可以保留文本中的所有空格、缩进等格式，从而在代码展示时能够更为清晰地展示。除此之外，光头强还运用了许多其他的HTML元素，比如元素、元素等，这些元素都是在构建网页时必不可少的。总之，HTML作为构建网页的基础语言，在前端开发中非常重要。光头强的这段HTML代码例子，为我们展示了HTML元素的使用方法和预格式化文本的展示方式，这对于初学者来说是非常有帮助的。

2023-05-13 09:23:43

468

软件工程师

HTML

代码靠右对齐html

...是一种常见的网页设计方法，它可以让代码更加规整，应用户更加轻松地阅读代码。在 HTML 中达成代码右侧对齐，我们可以应用 pre 标签来预先排版文本，而代码则放在 pre 标签中。下面，我们将详细了解如何应用 pre 标签达成代码右侧对齐。首先，我们需要在 HTML 页面中加入 pre 标签，从而将代码置于 pre 标签中。如下图所示：下面是一个应用 pre 标签达成代码右侧对齐的例子： .wrapper { margin: 0 auto; text-align: right; } 在这个例子中，我们用 pre 标签将代码放在了一起。pre 标签可以保持代码中的所有空格、换行和标点符号，使得代码的样式看起来非常规整。接下来，我们可以应用 CSS 将 pre 标签中的代码右侧对齐。具体来说，我们可以应用 text-align 属性来达成此目的。如下图所示：在这个例子中，我们在样式表中为 pre 标签设置了 text-align 属性，并将其设置为 right。这将使 pre 标签中的文本右侧对齐。总之，应用 pre 标签可以很容易地达成代码右侧对齐，这不仅可以提高代码的可读性和易用性，还可以让用户更加清晰地阅读代码。所以，在网页设计中应用 pre 标签是一个很好的选择，它可以使您的网站看起来更加整洁、专业和易于管理。

2023-12-23 13:34:14

540

键盘勇士

Java

java中pdf和string互转

...F文档页面添加内容的方法，如文本、图像等。在创建或编辑PDF文件时，通过PDPageContentStream，开发者能够在指定的PDF页面上设定文本样式（如字体、大小、颜色等），并精确控制文本的位置与布局，从而实现复杂且精细的PDF内容生成需求。

2023-08-30 10:08:22

315

键盘勇士

转载文章

[转载]Bootstrap框架class=thumbnail是什么意思？

...文档的一种小型版本，保留了大致内容和结构特征，常用于快速浏览大量内容时提供预览效果。在Bootstrap框架下，thumbnail 类专门用来创建图像或其他内容的缩略视图，通常带有链接至完整尺寸或更多详情页面的功能。响应式布局 , 响应式布局是一种网页设计方法，使网站能够根据访问设备的不同屏幕尺寸和方向自动调整布局、内容大小和功能展现方式。在Bootstrap框架中，响应式布局是其核心特性之一，通过一系列媒体查询和灵活的网格系统，确保网页在桌面、平板和手机等各种设备上都能提供良好的用户体验。

2023-06-08 11:31:22

299

转载

转载文章

[转载]html下拉框背景怎么设透明度,如何设置背景图片透明度

...代码可直接拷贝上来，保留HTML后，阅读器测试看看成就。本篇文章为转载内容。原文链接：https://blog.csdn.net/weixin_33047553/article/details/117796065。该文由互联网用户投稿提供，文中观点代表作者本人意见，并不代表本站的立场。作为信息平台，本站仅提供文章转载服务，并不拥有其所有权，也不对文章内容的真实性、准确性和合法性承担责任。如发现本文存在侵权、违法、违规或事实不符的情况，请及时联系我们，我们将第一时间进行核实并删除相应内容。

2023-06-07 16:19:06

258

转载

Python

python案列合并表格

...s模块中的read_excel方法加载多个Excel数据表，假设我们要组合的两个数据表分别是data1.xlsx和data2.xlsx。 df1 = pd.read_excel('data1.xlsx') df2 = pd.read_excel('data2.xlsx') 接下来，我们将两个数据表按照行方向组合在一起，即将两个数据表按照行的顺序拼接在一起。这可以采用pandas模块中的concat方法来实现。 df_merge = pd.concat([df1, df2], axis=0) 在这里，axis=0指定按照行的方向拼接，也就是垂直拼接。如果需求按照列的方向拼接，可以将axis改为1。代码的最后，我们可以将组合后的数据表保存到一个新的Excel文件中，以便后续的采用。 df_merge.to_excel('merged_data.xlsx', index=False) 这里的index=False表示不将索引写入Excel文件。如果需求将索引也保存到文件中，可以将index改为True或者不设置。通过这种方式，我们可以轻松地组合多个Excel数据表，并且保留原来的列名和列顺序。同时，我们可以在拼接前对每个数据表进行必要的清理和规范化加工，以免在后续解析过程中出现错误。

2023-09-19 20:02:05

数据库专家

CSS

CSS在表格布局中实现单元格四边独立内填充控制与易读性优化实践

...填充调整，其他方向则保留浏览器默认样式。 5. 结语到此为止，我们已经深入探讨了如何运用CSS来实现表格单元格内部填充的各种可能性。在实际动手操作的时候，灵活运用这些小技巧，就能帮咱们设计出更养眼、更易读、更具个性化的数据展示界面，让数据也能“活”起来，讲出自己的故事。让我们以开放的心态继续挖掘CSS的魅力，用创意和技术赋能我们的网页设计之旅吧！

2023-07-31 18:18:33

480

秋水共长天一色_

Bootstrap

Bootstrap 5 下拉菜单无法自动收回的解决方案：正确引入JavaScript库与初始化交互功能

...ap 组件库，它不仅保留了 Bootstrap 的样式和交互功能，还充分利用了 React 的优势，使得下拉菜单等组件的状态管理更为简便易控。另外，在用户体验设计领域，如何实现更自然流畅的交互效果是永恒的话题。对于下拉菜单这类常见组件，设计师和开发者不仅要考虑其实现机制，还需从用户行为、视觉反馈以及触屏设备适配等方面综合考量，以提供更加友好且符合预期的交互体验。因此，阅读相关的 UX 设计研究文献或实践案例，也能为解决类似问题带来新的启示和思路。总之，无论是紧跟前端技术发展趋势，还是深入探索用户体验设计原理，都能帮助开发者更好地应对如 Bootstrap 下拉菜单无法收回等问题，并在此过程中不断提升产品品质与自身技术水平。

2023-11-22 18:24:59

481

寂静森林_

Saiku

Saiku中Schema Workbench的维度设计与构建：从电商数据分析到业务逻辑实践

...务洞察的深度与广度。Saiku通过Schema Workbench提供的维度构建工具，赋予了用户灵活、高效的设计能力。然而，在实际操作中，除了掌握工具的使用方法，更应关注如何根据业务场景变化进行动态调整，以及如何结合新兴技术趋势提升维度设计的有效性。近期，随着大数据和人工智能技术的发展，智能化维度发现与优化成为新的研究热点。例如，基于机器学习的自动化维度识别系统能够快速从海量数据中抽取出关键的业务维度，并自动生成相应的维度层次结构。同时，实时分析与预测的需求也促使维度设计向实时更新、动态扩展的方向演进，以满足企业对市场变化快速响应的要求。此外，随着数据隐私保护法规日益严格，维度设计时还需充分考虑数据脱敏、权限控制等问题，确保在满足分析需求的同时符合合规要求。因此，未来维度设计不仅需要理论知识与实践经验的积累，更需紧跟技术潮流，将前沿技术与业务逻辑深度融合，以适应不断变化的数据生态和业务环境。

2023-11-09 23:38:31

101

醉卧沙场

转载文章

[转载]php中yield的用法

...中，之前有遇到过读取Excel文件时候，会出现内存不足，出现： Fatal Error: Allowed memory size of xxxxxx bytes 所以会设置php 最大运行内存的设置： ini_set('memory_limit', '200M') 但是当我们读取5g 这么大的文件的时候，我们运行内存可能就吃不消了，所以会选择yield 初识Yield 运行： <?phpfunction createRange($number){$data = [];for($i=0;$i<$number;$i++){$data[] = time();}return $data;}$data =createRange(10);foreach($data as $value){sleep(1);//这里停顿1秒，我们后续有用echo $value.PHP_EOL;} 时间是一样的。如果采用yield： <?phpfunction createRange($number){for($i=0;$i<$number;$i++){yield time();} }$data =createRange(10);foreach($data as $value){sleep(1);//这里停顿1秒，我们后续有用echo $value.PHP_EOL;} 时间则间隔一秒钟，所以通过yield 的例子知道，不是像第一个例子中把for 循环的内容储存在内存中，而是一个一个消耗。读取文件的例子创建一个txt 文件写入：第1行第2行第3行第4行第5行第6行第7行第8行 <?phpfunction readTxt(){ code...$handle = fopen("./test.txt", 'rb');while (feof($handle)===false) { code...yield fgets($handle);}fclose($handle);}foreach (readTxt() as $key => $value) { code...sleep(1);echo $value;} 用php 读取文件，则是一行一行的读取到这边，大概知道了yield 的作用了，之后咱再深入参考文章大文件导入导出优化本篇文章为转载内容。原文链接：https://blog.csdn.net/qq_22823581/article/details/91491082。该文由互联网用户投稿提供，文中观点代表作者本人意见，并不代表本站的立场。作为信息平台，本站仅提供文章转载服务，并不拥有其所有权，也不对文章内容的真实性、准确性和合法性承担责任。如发现本文存在侵权、违法、违规或事实不符的情况，请及时联系我们，我们将第一时间进行核实并删除相应内容。

2024-01-12 23:00:22

转载

Tesseract

改进Tesseract OCR识别效果：处理错误、优化图像预处理、参数调整及结果后处理实践

...能受到图片质量、字体样式、背景复杂度等因素的影响。所以，当遇到识别出岔子的时候，咱首先别急着满世界找解决办法，而是要先稳住心态，理解和欣然接受这个实际情况。接下来，咱就可以对症下药，要么琢磨着优化一下输入的照片，要么灵活调整一下参数设定，这样就对啦！ python import pytesseract from PIL import Image 假设我们有一张较为复杂的图片需要识别 img = Image.open('complex_image.png') text = pytesseract.image_to_string(img) 如果输出的text有误，那可能是因为原始图片的质量问题 2. 图像预处理为了提高识别准确性，对输入图像进行预处理是至关重要的一步。例如，我们可以进行灰度化、二值化、降噪、边界检测等操作。 python 对图片进行灰度化和二值化处理 img = img.convert('L').point(lambda x: 0 if x < 128 else 255, '1') 再次尝试识别 improved_text = pytesseract.image_to_string(img) 3. 调整识别参数 Tesseract提供了一系列丰富的可调参数以适应不同的场景。比如语言模型、是否启用特定字典、识别模式等。针对特定场景下的错误，可以通过调整这些参数来改善识别效果。 python 使用英语+数字的语言模型，同时启用多层识别 custom_config = r'--oem 3 --psm 6 -l eng' more_accurate_text = pytesseract.image_to_string(img, config=custom_config) 4. 结果后处理即便进行了以上优化，识别结果仍可能出现瑕疵。这时候，我们可以灵活运用自然语言处理技术对结果进行深加工，比如纠错、分词、揪出关键词这些操作，这样一来，文本的实用性就能噌噌噌地往上提啦！ python import re from nltk.corpus import words 创建一个简单的英文单词库 english_words = set(words.words()) 对识别结果进行过滤，只保留英文单词 filtered_text = ' '.join([word for word in improved_text.split() if word.lower() in english_words]) 5. 针对异常情况的处理当Tesseract抛出异常时，应遵循常规的异常处理原则。例如，捕获Image.open()可能导致的IOError，或者pytesseract.image_to_string()可能引发的RuntimeError等。 python try: img = Image.open('nonexistent_image.png') text = pytesseract.image_to_string(img) except IOError: print("无法打开图片文件！") except RuntimeError as e: print(f"运行时错误：{e}") 总结来说，处理Tesseract的错误和异常情况是一项涉及多个层面的工作，包括理解其内在局限性、优化输入图像、调整识别参数、结果后处理以及有效应对异常。在这个过程中，耐心调试、持续学习和实践反思都是非常关键的。让我们用人类特有的情感化思考和主观能动性去驾驭这一强大的工具，让Tesseract更好地服务于我们的需求吧！

2023-07-17 18:52:17

海阔天空

CSS

CSS 控制中文标点符号排版：字间距、white-space 与 letter-spacing 属性的实际运用

...过程中，CSS（层叠样式表）对于页面布局和样式的控制起着至关重要的作用。然而，在处理中文内容时，尤其是涉及到中文标点符号的排版问题，我们可能会遇到一些挑战。这篇文章会带你一起深入地“挖掘”这个主题，我们不仅会滔滔不绝地讨论，还会甩出一些实实在在的实例代码，手把手教你如何漂亮地搞定这些问题。 1. 中文标点符号的特殊性首先，让我们理解一下为什么中文标点符号在CSS排版中会引发问题。不同于英文标点，中文标点通常具有更强的内联性，例如全角句号、逗号等不会出现在单词或句子的尾部，而是紧贴前一个字符。此外，中文段落间的换行规则也与英文不同，新段落不直接跟在上一段文字后面，而是需要保持一定的缩进距离。 html 这是一段中文文本，结尾的句号应该紧贴前一个字。这是新的一段，注意它与上一段之间的间距。 2. CSS中的默认排版行为在默认情况下，浏览器根据W3C规范对中文标点进行处理，但在某些场景下，如自定义字体、行高、字间距等因素可能会影响标点符号的正常排布。 css / 默认CSS / body { font-family: '宋体', sans-serif; } / 这种情况下标点符号一般能正确显示，但如果更换其他非中文字体，可能出现标点位置异常 / 3. 解决方案一调整字间距为了解决标点过于紧凑或分散的问题，我们可以利用CSS的letter-spacing属性调整字间距，确保标点符号与汉字间有合适的间距。 css p { letter-spacing: normal; / 或者设置具体像素值，如0.1em / } 4. 解决方案二使用white-space属性针对中文段落换行问题，可以运用white-space属性。例如，使用pre-wrap可保留文本中的换行符并允许自动换行。 css p { white-space: pre-wrap; text-indent: 2em; / 设置首行缩进以符合中文段落排版习惯 / } 5. 解决方案三针对特定标点符号的定位对于个别特殊的标点符号，还可以通过伪元素结合margin或padding实现精准定位。 css p::after { content: "。"; / 添加一个全角句号 / margin-left: -0.1em; / 微调标点符号的位置 / } 6. 思考与探讨虽然以上方法能够有效改善中文标点符号的排版效果，但实际应用中还需结合具体场景灵活调整。同时，随着CSS3及Web typography的发展，诸如text-align-last、line-break等高级特性也为更精细的排版提供了可能。因此，在优化中文排版体验的过程中，我们需要不断学习和探索，让CSS更好地服务于我们的多语言网页设计。总结来说，面对CSS中的中文标点符号排版问题，关键在于理解其内在规律，借助CSS属性工具箱，辅以细致入微的调试与观察，才能达到理想的效果。在这个过程中，作为开发者大伙儿，咱们得把每一个细节都当作是手中的艺术品在精心打磨，得用真心去感知、去打造那种让人读起来超爽的体验，就像工匠对自己的作品精雕细琢一样。

2023-06-22 11:49:35

441

彩虹之上_

CSS

去掉聚焦文字输入框光标竖线：CSS outline与用户体验平衡之道

...实，它是由浏览器默认样式决定的。当你给某个东西设置了“被选中”的状态（比如你点了一下那个东西让它高亮），浏览器就会自动画一道竖线出来。这可不是为了好看，而是为了告诉咱们：嘿！这里就是现在焦点所在的地方！从技术上讲，这个竖线是由 CSS 中的 outline 属性控制的。outline 是一种特殊的边框属性，专门用来表示元素的焦点状态。默认啊，浏览器总会给输入框这些能编辑的东西自动加上一根蓝线或者灰线，就是那个让你一眼就能看出“这是可以输入的地方”的小标志。不过，这也带来了一个问题：虽然 outline 的初衷是为了提升用户体验，但在某些场景下，它可能会破坏整体的设计效果。比如： - 影响视觉美感：如果页面的颜色搭配非常讲究，那根竖线可能会显得格格不入。 - 无障碍问题：对于一些用户来说，这根竖线可能并不是必要的，甚至会分散注意力。所以，如果我们想要更精致的设计，就需要学会如何自定义或者完全移除这个竖线。 --- 3. 解决方案如何优雅地去掉光标竖线？现在我们知道了问题的根源，接下来就是动手解决问题啦！这里有几种方法可以帮助你去掉或者自定义光标竖线，每种方法都有其优缺点，大家可以结合自己的需求选择适合的方式。方法一：直接移除 outline 最简单粗暴的方法就是直接通过 CSS 将 outline 设置为 none。这个方法能直接去掉那些烦人的竖线，不过得小心点！因为用完之后，当你切换焦点的时候，可能就分不清到底哪个东西是被选中的了。所以啊，不到万不得已，还是别轻易尝试啦！ css input:focus { outline: none; } 优点：操作简单，立刻生效。缺点：失去焦点时可能会影响用户的体验。方法二：自定义 outline 样式与其完全移除 outline，不如换个方式让它变得更和谐。你可以调整那个竖线的“轮廓”——比如它的颜色、粗细，还有样子，让它跟你的整体设计更搭，看起来不那么突兀。 css input:focus { outline: 2px solid FFD700; / 黄色外框 / outline-offset: 4px; / 外框距离内容的距离 / } 优点：既保留了焦点提示功能，又能让竖线看起来更美观。缺点：需要额外的时间去调整样式。方法三：用 box-shadow 替代 outline 如果你不想用传统的 outline，可以尝试用 box-shadow 来模拟焦点效果。这样弄出来的效果特别自然，而且跟那种传统的“轮廓线”比起来，完全不会显得死板或突兀，看着就舒服多了！ css input:focus { box-shadow: 0 0 5px rgba(0, 0, 255, 0.5); / 蓝色阴影 / border: none; / 移除原有边框 / } 优点：灵活性高，可以根据需求定制阴影效果。缺点：需要更多的测试来确保兼容性。 --- 4. 实战演练结合实际案例看看效果为了让大家更好地理解这些方法的实际效果，我准备了一些简单的代码示例，大家可以复制到本地试一试。示例一：完全移除 outline html Remove Outline 示例二：自定义 outline 样式 html Custom Outline 示例三：用 box-shadow 模拟焦点 html Box Shadow Example --- 5. 总结与反思做设计还是做用户体验？写到这里，我觉得有必要停下来聊一聊设计和用户体验之间的平衡。很多时候，我们追求极致的视觉效果，却忽略了用户的实际感受。虽然去掉光标竖线可以让界面更整洁，但也可能让用户感到困惑。所以，在决定是否去掉竖线之前，不妨问问自己：这样做真的对用户更好吗？如果答案是肯定的，那就大胆去做吧！但如果不确定，不妨先测试一下，看看用户的反馈如何。总之，技术永远是为了服务于人，而不是让人迁就技术。希望今天的分享能给大家带来一些启发，同时也希望大家能在实践中不断探索和成长！好了，今天的分享就到这里啦！如果你还有什么疑问或者想法，欢迎在评论区留言交流哦～咱们下次再见！

2025-04-27 15:35:12

风轻云淡_

Saiku

Saiku界面功能区详解：主界面、工作区、维度/度量区与结果展示区布局及交互式探索功能解析

...数据分析、快速查询和报表生成而设计。在Saiku这款工具中，用户可通过图形化界面进行OLAP操作，无需编写代码即可对多维数据集进行切片、钻取、旋转等交互式探索，从而深入洞察业务趋势与模式。数据透视表 , 数据透视表是一种动态的、交互式的表格，允许用户以多种角度对大量数据进行汇总、比较和分析。在Saiku的结果展示区中，用户可以根据需要调整行、列、值以及过滤条件，系统将自动重新组织并计算数据，生成能够直观反映数据内在关系和分布特点的视图。钻取功能 , 在商业智能和数据分析领域，钻取是指用户可以从汇总数据深入到细节数据的过程，或者从一个粒度级别切换到另一个更细或更粗粒度级别的能力。在Saiku中，用户可以利用钻取功能，在查看某一层次的数据统计结果时，进一步向下挖掘至下一级别或上一级别的明细数据，以便于从不同维度深入理解数据，实现多层级的数据洞察。商业智能（BI） , 商业智能是一套综合的方法论、应用软件和服务，用于收集、整合、分析企业内外部数据，并通过可视化的方式将这些信息呈现给决策者，以便他们做出明智、数据驱动的业务决策。在文中，Saiku被描述为顺应现代BI发展趋势的工具，它通过提供自助服务式的分析平台，助力非技术人员也能独立完成深度数据探索。

2023-10-04 11:41:45

104

初心未变

转载文章

[转载]半自动化批量下载专利全文pdf傻瓜攻略

...每次搞完都没有把文档保留下来，下次有点什么事情又得从头开始。因此准备开始写写文档记录一些思路，同时如果能帮到有需要的人就更好了！适合人群不会爬虫的都可以来看看！能大概看明白python就够了。使用前提 python环境配好有梯子不排斥键鼠记录器读取键鼠记录基本思路现在的专利搜索引擎大概都有批量下载库，如果只要摘要的话直接下载就可以了。但是下载全文的时候，大部分引擎都不支持批量下载，只能一个一个点，还得输验证码。这里就不得不提到google patent了，这是我目前找到的唯一一个不需要验证码就能下载的专利引擎了（其实主要是还不会用python识别验证码）。那么有了google patent这个神器，就可以用自动办法来进行下载了。我这里使用的是按键精灵，傻瓜式操作。（没用python爬虫的原因是requests不能挂梯子。。。这里我不是很确定是什么问题，希望有大佬指点一下。anyway，主要思路就是用键鼠记录器点点点，我用的是按键精灵，理论上什么记录器都可以。 ps. 听说poxoq能批量下载，但是新版本只能下载前十页，因此我没有尝试，如果能直接下载全文的话请评论区告诉我。键鼠记录器脚本前期准备按格式排好公开号或者申请号，在编辑器中打开；把google patent搜索页面和文本编辑器分屏显示，便于操作。脚本原理以edge浏览器为例，按键精灵双击全选文本中第一行的公开号，ctrl+c复制，鼠标转到网页搜索框，ctrl+v粘贴，点搜索。等搜索完成右键download PDF，选链接另存为并确定，之后点击网页关闭下载栏，一次下载完成。返回编辑器，删除第一行的文本，把第二行提到第一行，完成复位。这样就形成了完整的一次过程，只要重复运行脚本就可以把所有专利全文下载下来。注意事项实际操作中，可能遇到两大问题：网页反馈问题这里指的是搜索后没有来到我们想象中的专利页，可能是没有搜索到专利，或该专利google patent没有pdf文档，这时如果脚本还在运行，那么显然就会错误运行。脚本运行问题主要要考虑的是命令之间的延时。延时调小确实运行速度会变快，但是如果电脑运行速度不够或者网速/服务器慢了，就会错误执行命令。我的建议是文本操作可以适当删减延时，涉及网页的部分适量增加延时，保证脚本的容错率。由此可以看出来这个脚本还是离不开人的，在跑的时候还是需要盯着点，如果有错误可以及时处理。检查下载效果看了上面的注意事项，想必你也知道这个脚本不太靠谱。那么解决这个问题的方法就是负反馈。下载完了检查一遍就好了。由于google patent下载的文件是以公开号命名的，所以对照要下载的和已下载的公开号就能看出哪些专利没有下载成功。我这里写了一个python小脚本。 import pandas as pdimport os读取待下载专利的公开号，地址修改成你自己存放的位置df = pd.read_excel("target.xlsx",header= 0, usecols= "B").drop_duplicates()取前11位作为对比（以中国专利作为参考）PublicNumber_tgt = list(map(lambda x: x[0:11],df["公开（公告）号"].to_list()))读取已下载专利的公开号，地址修改成你自己存放的位置filelist=os.listdir(r'C:\Users\mornthx\Desktop\专利全文')取前11位作为对比PublicNumber_dl = list(map(lambda x: x[0:11],filelist))比较两者差值diff = set(PublicNumber_tgt).difference(set(PublicNumber_dl))print(diff) 没下载的专利具体问题具体解决就好了。希望能帮到大家！本篇文章为转载内容。原文链接：https://blog.csdn.net/weixin_38688347/article/details/124000919。该文由互联网用户投稿提供，文中观点代表作者本人意见，并不代表本站的立场。作为信息平台，本站仅提供文章转载服务，并不拥有其所有权，也不对文章内容的真实性、准确性和合法性承担责任。如发现本文存在侵权、违法、违规或事实不符的情况，请及时联系我们，我们将第一时间进行核实并删除相应内容。

2023-11-21 12:55:28

274

转载

转载文章

[转载]html5 footer header,html-5 --html5教程article、footer、header、nav、section使用

... 结构元素不具有任何样式,只是使页面元素的的语义更加明确. header元素 header元素是一种具有引导和导航作用的的结构元素,该元素可以包含所有通常放在页面头部的内容.header元素通常用来放置 ... html5，html5教程 html5,html5教程 1.向后兼容 HTML5是这样被定义的:能向后兼容目前UA处理内容的方式.为了让语言更简单,一些老的元素和Attribute被舍弃.比如一些纯粹用于展现的元素(译注:即非语 ... 一步HTML5教程学会体系 HTML5是HTML最新的版本,万维网联盟. HTML5是下一代的HTML标准,HTML5是为了在移动设备上支持多媒体. 新特性: 绘画的canvas元素,用于媒介回放的video和audio元素,对 ... IT兄弟连 HTML5教程了解HTML5的主流应用1 在很多人眼里,HTML5与互联网营销密切相关,但其实从开发者的角度而言,它是一种网页标准,定义了浏览器语言的编写规范.伴随HTML5标准尘埃落定,浏览器对HTML5特性的逐步支持,再加上国内对HTML ... 【转帖】39个让你受益的HTML5教程 39个让你受益的HTML5教程闲话少说,本文作者为大家收集了网上学习HTML5的资源,期望它们可以帮助大家更好地学习HTML5. 好人啊! 不过,作者原来说的4 ... 【特别推荐】Web 开发人员必备的经典 HTML5 教程对于我来说,Web 前端开发是最酷的职业之一,因为你可以用新的技术发挥,创造出一些惊人的东西.唯一的问题是,你需要跟上这个领域的发展脚步,因此,你必须不断的学习,不断的前进.本文将分享能够帮助您快速掌 ... HTML5教程之本地存储SessionStorage SessionStorage: 将数据保存在session对象中,所谓session是指用户在浏览某个网站时,从进入网站到浏览器关闭所经过的这段时间会话,也就是用户浏览这个网站所花费的时间就是sess ... 随机推荐【转】MySQL索引背后的数据结构及算法原理摘要本文以MySQL数据库为研究对象,讨论与数据库索引相关的一些话题.特别需要说明的是,MySQL支持诸多存储引擎,而各种存储引擎对索引的支持也各不相同,因此MySQL数据库支持多种索引类型,如BT ... IIS7 / IIS7.5 URL 重写 HTTP 重定向到 HTTPS(转) 转自: http://www.cnblogs.com/yipu/p/3880518.html 1.购买SSL证书,参考:http://www.cnblogs.com/yipu/p/3722135. ... OpenGL的glViewPort窗口设置函数实现分屏之前实现过全景图片查看(OpenGL的几何变换3之内观察全景图),那么我们需要进行分屏该如何实现呢?如下图: 没错就是以前提过的glViewPort函数,废话不多说了,我直接上代码: //从这里开始进 ... hdu 4764 Stone (巴什博弈，披着狼皮的羊，小样，以为换了身皮就不认识啦) 今天(2013/9/28)长春站,最后一场网络赛! 3~5分钟后有队伍率先发现伪装了的签到题(博弈) 思路: 与取石头的巴什博弈对比题目要求第一个人取数字在[1,k]间的某数x,后手取x加[1,k] ... android报表图形引擎(AChartEngine)demo解析与源码 AchartEngine支持多种图表样式,本文介绍两种:线状表和柱状表. AchartEngine有两种启动的方式:一种是通过ChartFactory.getView()方式来直接获取到view ... CSS长度单位及区别 em ex px pt in 1. css相对长度单位 Ø em 元素的字体高度 Ø ex 字体x的高度 Ø px ... es6的箭头函数 1.使用语法 : 参数 => 函数语句; 分为以下几种形式 : (1) ()＝>语句 ( )＝> statement 这是一种简写方法省略了花括号和return 相当于 ()＝&g ... pdfplumber库解析pdf格式参考地址:https://github.com/jsvine/pdfplumber 简单的pdf转换文本: import pdfplumber with pdfplumber.open(path) a ... KMP替代算法——字符串Hash 很久以前写的... 今天来谈谈一种用来替代KMP算法的奇葩算法--字符串Hash 例题:给你两个字符串p和s,求出p在s中出现的次数.(字符串长度小于等于1000000) 字符串的Hash 根据字面意 ... SSM_CRUD新手练习(5)测试mapper 上一篇我们使用逆向工程生成了所需要的bean.dao和对应的mapper.xml文件,并且修改好了我们需要的数据库查询方法. 现在我们来测试一下DAO层,在test包下新建一个MapperTest.j ... 本篇文章为转载内容。原文链接：https://blog.csdn.net/weixin_35666639/article/details/118169985。该文由互联网用户投稿提供，文中观点代表作者本人意见，并不代表本站的立场。作为信息平台，本站仅提供文章转载服务，并不拥有其所有权，也不对文章内容的真实性、准确性和合法性承担责任。如发现本文存在侵权、违法、违规或事实不符的情况，请及时联系我们，我们将第一时间进行核实并删除相应内容。

2023-07-16 11:42:34

252

转载

转载文章

[转载]Java爬虫学习一一Jsoup爬取彼岸桌面分类下的图片

...里我添加了一个比较的方法供之后判断输入的分类名是否包含在这些分类里面。接下来我们在分析分类面的展示情况，以美女分类页面为例(●´∀｀●)，最下边有分页，如果只获取这个页面的图片并不能获取所有美女图，我们还需要点击每一个分页，从分页中获取所有的图片。通过分析发现，第一页的链接是在原有链接基础上拼接“/index.htm”，从第二页之后拼接的是“/index_页号.htm”。这样我们只需要获取总页数在依次遍历拼接就可以了，现在的问题是如何获取总页数，我一开始的想法是获取分页中“共167页”这个标签后再只保留数字就可以个，但发现运行后获取不到该元素节点，经过排查了解到这个标签是通过js生成的，于是我转换了思路，通过获取最后一个页号来得到一共分了多少页 Document root_doc = Jsoup.connect("http://www.netbian.com/" + kind + "/").get();Elements els = root_doc.select("main .page a");//这里els.eq(els.size() - 2的原因是后边确定按钮用的是a标签要去掉，再去掉一个“下一页”标签Integer page = Integer.parseInt(els.eq(els.size() - 2).text()); 分类页中图片所在的标签结构为：分类页面下的图片不是我们想要的，我们想要的是点击进去详细页的高清大图，所以需要获取a标签的链接，再从这个链接中获取真正想要的图片。详细页中图片所在的标签结构为：二、代码实现到这里分类页分析的差不多了，我们通过代码来进行获取图片。首先导入Jsoup的jar包：jsoup-1.12.1.jar，如果采用Maven请导入下边的依赖。 <dependency><groupId>org.jsoup</groupId><artifactId>jsoup</artifactId><version>1.12.1</version></dependency> 在utils创建JsoupPic类，并添加getPic方法，代码如下： public static void getPic(String kind) throws Exception {//get请求方式进行请求Document root_doc = Jsoup.connect("http://www.netbian.com/" + kind + "/").get();//获取分页标签，用于获取总页数Elements els = root_doc.select("main .page a");Integer page = Integer.parseInt(els.eq(els.size() - 2).text());for (int i = 1; i < page; i++) {Document document = null;//这里判断的是当前页号是否为1，如果为1就不拼页号，否则拼上对应的页号if (i == 1) {document = Jsoup.connect("http://www.netbian.com/" + kind + "/index.htm").get();} else {document = Jsoup.connect("http://www.netbian.com/" + kind + "/index_" + i + ".htm").get();}//获取每个分页链接里面a标签的链接，进入链接页面获取当前图拼的大尺寸图片Elements elements = document.select("main .list li a");for (Element element : elements) {String href = element.attr("href");String picUrl = "http://www.netbian.com" + href;Document document1 = Jsoup.connect(picUrl).get();Elements elements1 = document1.select(".endpage .pic p a img");//获取所有图片的链接System.out.println(elements1);} }} 在分类页中有一个隐藏的问题图片：正常的图片链接都是以“/”开头，以“.htm”结尾，而每个分类下的第三张图片的链接都是“http://pic.netbian.com/”，如果不过滤的话会报如下错误：所以这里必须要判断一下: Elements elements = document.select("main .list li a");for (Element element : elements) {String href = element.attr("href");//判断是否是以“/”开头if (href.startsWith("/")) {String picUrl = "http://www.netbian.com" + href;Document document1 = Jsoup.connect(picUrl).get();Elements elements1 = document1.select(".endpage .pic p a img");System.out.println(elements1);} } 到这里，页面就已经分析好了，问题基本上已经解决了，接下来我们需要将图片存到我们的系统里，这里我将图片保存到我的电脑桌面上，并按照分类来存储图片。首先是要获取桌面路径，在utils包下创建Download类，添加getDesktop方法，代码如下： public static File getDesktop(){FileSystemView fsv = FileSystemView.getFileSystemView();File path=fsv.getHomeDirectory(); return path;} 接着我们再该类中添加下载图片的方法： //urlPath为网络图片的路径，savePath为要保存的本地路径（这里指定为桌面下的images文件夹）public static void download(String urlPath,String savePath) throws Exception {// 构造URLURL url = new URL(urlPath);// 打开连接URLConnection con = url.openConnection();//设置请求超时为5scon.setConnectTimeout(51000);// 输入流InputStream is = con.getInputStream();// 1K的数据缓冲byte[] bs = new byte[1024];// 读取到的数据长度int len;// 输出的文件流File sf=new File(savePath);int randomNo=(int)(Math.random()1000000);String filename=urlPath.substring(urlPath.lastIndexOf("/")+1,urlPath.length());//获取服务器上图片的名称filename=new java.text.SimpleDateFormat("yyyy-MM-dd-HH-mm-ss").format(new Date())+randomNo+filename;//时间+随机数防止重复OutputStream os = new FileOutputStream(sf.getPath()+"\\"+filename);// 开始读取while ((len = is.read(bs)) != -1) {os.write(bs, 0, len);}// 完毕，关闭所有链接os.close();is.close();} 写好后，我们再完善一下JsouPic中的getPic方法。 public static void getPic(String kind) throws Exception {//get请求方式进行请求Document root_doc = Jsoup.connect("http://www.netbian.com/" + kind + "/").get();//获取分页标签，用于获取总页数Elements els = root_doc.select("main .page a");Integer page = Integer.parseInt(els.eq(els.size() - 2).text());for (int i = 1; i < page; i++) {Document document = null;//这里判断的是当前页号是否为1，如果为1就不拼页号，否则拼上对应的页号if (i == 1) {document = Jsoup.connect("http://www.netbian.com/" + kind + "/index.htm").get();} else {document = Jsoup.connect("http://www.netbian.com/" + kind + "/index_" + i + ".htm").get();}File desktop = Download.getDesktop();Download.checkPath(desktop.getPath() + "\\images\\" + kind);//获取每个分页链接里面a标签的链接，进入链接页面获取当前图拼的大尺寸图片Elements elements = document.select("main .list li a");for (Element element : elements) {String href = element.attr("href");if (href.startsWith("/")) {String picUrl = "http://www.netbian.com" + href;Document document1 = Jsoup.connect(picUrl).get();Elements elements1 = document1.select(".endpage .pic p a img");Download.download(elements1.attr("src"), desktop.getPath() + "\\images\\" + kind);} }} } 在Download类中，我添加了checkPath方法，用于判断目录是否存在，不存在就创建一个。 public static void checkPath(String savePath) throws Exception {File file = new File(savePath);if (!file.exists()){file.mkdirs();} } 最后在mainapp包内创建PullPic类，并添加主方法。 package com.asahi.mainapp;import com.asahi.common.Kind;import com.asahi.common.PrintLog;import com.asahi.utils.JsoupPic;import java.util.Scanner;public class PullPic {public static void main(String[] args) throws Exception {new PullPic().downloadPic();}public void downloadPic() throws Exception {System.out.println("启动程序>>\n请输入所爬取的分类：");Scanner scanner = new Scanner(System.in);String kind = scanner.next();while(!Kind.contains(kind)){System.out.println("分类不存在，请重新输入：");kind = scanner.next();}System.out.println("分类输入正确！");System.out.println("开始下载>>");JsoupPic.getPic(kind);} } 三、成果展示最终的运行结果如下：最终的代码已上传到我的github中，点击“我的github”进行查看。在学习Java爬虫的过程中，我收获了很多，一开始做的时候确实遇到了很多困难，这次写的获取图片也是最基础的，还可以继续深入。本来我想写一个通过多线程来获取图片来着，也尝试着去写了一下，越写越跑偏，暂时先放着不处理吧，等以后有时间再来弄，我想问题应该不大，只是考虑的东西有很多。希望大家多多指点不足，有哪些需要改进的地方，我也好多学习学习๑乛◡乛๑。本篇文章为转载内容。原文链接：https://blog.csdn.net/qq_39693281/article/details/108463868。该文由互联网用户投稿提供，文中观点代表作者本人意见，并不代表本站的立场。作为信息平台，本站仅提供文章转载服务，并不拥有其所有权，也不对文章内容的真实性、准确性和合法性承担责任。如发现本文存在侵权、违法、违规或事实不符的情况，请及时联系我们，我们将第一时间进行核实并删除相应内容。

2023-06-12 10:26:04

130

转载

知识学习

实践的时候请根据实际情况谨慎操作。

随机学习一条linux命令：

groups user - 显示用户所属的组。