初识Lucene-索引与搜索

本文介绍如何使用Lucene-4.2.1版本建立文本文件的索引,并通过索引进行高效搜索。主要涉及两个核心Java类:Indexer和Searcher。Indexer负责创建索引,对指定文件夹下的.txt文件进行索引;Searcher则负责从已建立的索引中搜索特定文本。

Lucene首先要建立索引,才能进行搜索,使用了最新的lucene-4.2.1包

1.Indexer.java

/**
 * 索引器
 * @author shishengjie
 *
 */
public class Indexer {
	
	private IndexWriter writer;//写索引,负责创建索引或打开已有索引等等

	public Indexer(String indexDir) throws IOException {
		//Directory描述索引存放的位置
		Directory dir = FSDirectory.open(new File(indexDir));
		//分析器,文本文件在被索引之前需要经过Analyzer处理
		Analyzer luceneAnalyzer = new StandardAnalyzer(Version.LUCENE_42);
		IndexWriterConfig config = new IndexWriterConfig(Version.LUCENE_42,
				luceneAnalyzer);
		writer = new IndexWriter(dir, config);//创建写索引

	}

	public void close() throws IOException {
		writer.close();
	}
	/**
	 * 文件过滤器 过滤所有非.txt文件
	 * @author shishengjie
	 *
	 */
	private static class TextFilesFilter implements FileFilter {

		@Override
		public boolean accept(File pathname) {
			// TODO Auto-generated method stub
			return pathname.getName().toLowerCase().endsWith(".txt");
		}

	}
	/**
	 * 建立索引
	 * @param dataDir
	 * @param filter
	 * @return
	 * @throws IOException
	 */
	public int index(String dataDir, FileFilter filter) throws IOException {
		File files[] = new File(dataDir).listFiles();//索引文件夹下所有文件
		for (File f : files) {
			if (!f.isDirectory() && !f.isHidden() && f.exists() && f.canRead()
					&& (filter == null || filter.accept(f))) {
				indexFile(f);//将文件加入所索引
			}
		}
		return writer.numDocs();
	}

	/**
	 * 向索引中添加文档
	 * @param f
	 * @throws IOException
	 */
	private void indexFile(File f) throws IOException {
		System.out.println("Indexing " + f.getCanonicalPath());
		//根据文件名获取文档,Document代表一些域Filed的集合
		Document doc = getDocument(f);
		//加入到索引中
		writer.addDocument(doc);
	}

	/**
	 * 根据文件返回Document
	 * @param f
	 * @return
	 * @throws IOException
	 */
	private Document getDocument(File f) throws IOException {
		Document doc = new Document();//创建文档
		doc.add(new Field("contents", new FileReader(f)));
		doc.add(new Field("filename", f.getName(), Field.Store.YES,
				Field.Index.NOT_ANALYZED));
		doc.add(new Field("fullpath", f.getCanonicalPath(), Field.Store.YES,
				Field.Index.NOT_ANALYZED));//添加域Filed
		return doc;
	}

	public static void main(String[] args) {
		try {
			if (args.length != 2) {
				throw new IllegalAccessException("Usage:java "
						+ Indexer.class.getName() + " <index dir> <data dir>");
			}

			String indexDir = args[0];	//此处存放索引文件
			String dataDir = args[1];	//对该文件夹下的文件建立索引

			long start = System.currentTimeMillis();
			//创建索引,indexDir为索引存放位置
			Indexer indexer = new Indexer(indexDir);
			int numIndexed;
			try {
				//对dataDir文件夹下的文件建立索引
				numIndexed = indexer.index(dataDir, new TextFilesFilter());
			} finally {
				indexer.close();
			}
			long end = System.currentTimeMillis();
			System.out.println("Indexing " + numIndexed + " files took "
					+ (end - start) + " milliseconds");
		} catch (Exception e) {
			e.printStackTrace();
		}
	}

}

运行时需要输入2个参数,第一个为要存放索引的文件夹,第二个为要索引哪个文件夹下的文件

如:C:\Users\shishengjie\Desktop\lucene\indexDir  C:\Users\shishengjie\Desktop\lucene\lucene-4.2.1\

将会扫描C:\Users\shishengjie\Desktop\lucene\lucene-4.2.1\文件夹下的txt文件,为其建立索引,创建的索引存放在C:\Users\shishengjie\Desktop\lucene\indexDir下面

输出为:

Indexing C:\Users\shishengjie\Desktop\lucene\lucene-4.2.1\CHANGES.txt
Indexing C:\Users\shishengjie\Desktop\lucene\lucene-4.2.1\JRE_VERSION_MIGRATION.txt
Indexing C:\Users\shishengjie\Desktop\lucene\lucene-4.2.1\LICENSE.txt
Indexing C:\Users\shishengjie\Desktop\lucene\lucene-4.2.1\MIGRATE.txt
Indexing C:\Users\shishengjie\Desktop\lucene\lucene-4.2.1\NOTICE.txt
Indexing C:\Users\shishengjie\Desktop\lucene\lucene-4.2.1\README.txt
Indexing C:\Users\shishengjie\Desktop\lucene\lucene-4.2.1\SYSTEM_REQUIREMENTS.txt
Indexing 21 files took 2479 milliseconds


 


2.Searcher.java

/**
 * 查找器
 * @author shishengjie
 *
 */
public class Searcher {

	public static void main(String[] args) throws Exception {

		if (args.length != 2) {
			throw new IllegalAccessException("Usage:java "
					+ Searcher.class.getName() + " <index dir> <data dir>");
		}
		String indexDir = args[0];//索引文件夹
		String q = args[1];//要检索的字符
		search(indexDir, q);//查找
	}

	/**
	 * 查找
	 * @param indexDir
	 * @param q
	 * @throws Exception
	 */
	private static void search(String indexDir, String q) throws Exception {
		//索引存放的位置处创建Directory
		Directory dir = FSDirectory.open(new File(indexDir));
		// 读取索引的indexReader
		IndexReader indexReader = IndexReader.open(dir);
		// 创建indexSearcher,用于搜索由IndexWriter类创建的索引
		IndexSearcher is = new IndexSearcher(indexReader);
		//解析查询字符串
		QueryParser parser = new QueryParser(Version.LUCENE_42, "contents",
				new StandardAnalyzer(Version.LUCENE_42));
		//将人可读的查询解析为Query
		Query query = parser.parse(q);
		long start = System.currentTimeMillis();
		//查询,以TopDocs对象的形式返回搜索结果集
		//TopDocs是一个简单的指针容器,指向前N个排名的搜索结果
		//TopDocs只包括对于文档的引用IndexSearcher.doc时才加载
		TopDocs hits = is.search(query, 10);
		long end = System.currentTimeMillis();
		System.err.println("Found " + hits.totalHits + " document(s) (in "
				+ +(end - start) + " milliseconds) that matched query '" + q
				+ "'");
		//输出匹配的文本
		for (ScoreDoc scoreDoc : hits.scoreDocs) {
			Document doc = is.doc(scoreDoc.doc);//返回匹配文本
			System.out.println(doc.get("fullpath"));
		}

	}

}


运行时需要输入2个参数,第一个为要存放索引的文件夹,第二个为要查询的单词

如:C:\Users\shishengjie\Desktop\lucene\indexDir  patent

将会读取索引,查找patent文件

输出为:

Found 6 document(s) (in 191 milliseconds) that matched query 'java'
C:\Users\shishengjie\Desktop\lucene\lucene-4.2.1\JRE_VERSION_MIGRATION.txt
C:\Users\shishengjie\Desktop\lucene\lucene-4.2.1\SYSTEM_REQUIREMENTS.txt
C:\Users\shishengjie\Desktop\lucene\lucene-4.2.1\README.txt
C:\Users\shishengjie\Desktop\lucene\lucene-4.2.1\NOTICE.txt
C:\Users\shishengjie\Desktop\lucene\lucene-4.2.1\LICENSE.txt
C:\Users\shishengjie\Desktop\lucene\lucene-4.2.1\CHANGES.txt


 

内容概要:本文研究了基于DPWMA调制正负序分离的ANPC三电平并网逆变器前馈控制策略,旨在解决传统三电平逆变器存在的谐波含量高、电网不平衡工况适应性差及动态响应速度不足等问题。通过采用有源中点箝位(ANPC)三电平逆变器拓扑,结合双极性倍频脉宽调制(DPWMA)、正负序分离锁相技术和电网电压前馈控制,构建了一套一体化的高性能并网控制体系。该体系不仅优化了逆变器的开关动作机制,改善了输出电压电流的谐波特性,而且通过精确的相位同步和扰动补偿,显著提高了系统的动态响应能力和抗扰性能。仿真结果显示,所提出的控制策略能有效降低并网谐波含量,提升锁相精度系统动态稳定性,确保在复杂电网工况下的高质量稳定并网。 适合人群:具备一定电力电子基础知识和仿真技能的研发人员,尤其是从事新能源发电、储能系统、柔性输电等领域研究的专业人士。 使用场景及目标:①研究和开发高性能并网逆变器,特别是针对大功率、高电能质量要求的应用场景;②探索如何通过先进的调制和控制策略来提高并网逆变器对电网扰动的适应性和响应速度;③为相关领域的学术研究和技术开发提供理论依据和实践指导。 阅读建议:建议读者结合实际的仿真软件(如MATLAB/Simulink)进行实践操作,以便更好地理解和掌握文中提到的各种控制策略的具体实现方法。同时,鼓励读者关注最新的研究成果和发展趋势,不断深化对该领域的认识。
摘要 在全球生态环境问题日益严峻、公众环保参意愿持续提升的背景下,传统环保志愿者招募管理模式存在信息传播零散、供需对接不畅、管理效率低下等痛点,制约了环保公益事业的规模化发展。为解决上述问题,响应生态保护数字化发展需求,本课题设计实现“守望自然”环保志愿者招募管理网站,通过数字化手段打通环保组织志愿者的服务链路,对推动环保公益规范化、高效化发展具有重要的现实意义实践价值。 该网站采用B/S架构前后端分离模式开发,前端基于Vue架构建组件化响应式界面;后端以Java为开发语言,采用Spring Boot框架搭建应用,搭配MyBatis作为持久层框架,数据库选用MySQL并遵循第三范式设计7个以上核心数据表。系统涵盖用户管理员两大核心角色,实现了闭环式环保志愿服务功能:用户端支持注册登录、个人信息管理、活动查询报名、环保知识学习、社区互动、问题反馈及客服咨询等功能,满足用户全流程参需求;管理员端具备用户管理、用户审核、招募活动信息发布管理、环保知识内容管理、问题反馈处理、证书模板管理、多维度数据可视化分析及社区内容监管等功能,全面支撑环保组织运营管理。开发过程中集成了Token身份认证、MD5密码加密、ECharts数据可视化等关键技术,融入活动智能推荐、数据驱动决策等创新设计,确保系统功能完备性实用性。 经功能测试、性能测试及安全测试验证,系统运行稳定可靠,具有良好的易用性、安全性和可扩展性,能够高效满足环保组织的用户招募管理需求用户的多元化参需求,有效降低环保组织运营成本,提升用户参体验,为环保理念传播公益事业发展提供有力的数字化支撑。 关键词:环保志愿者;招募管理系统;Spring Boot;Vue;数据可视化
特等奖标准成品论文(Word无水印纯净版) 硬核结构:全文包含完整的摘要、问题重述分析、模型假设、符号说明、模型建立求解、灵敏度分析及结论。 即插即用:排版严格遵循官方规范,逻辑严密。拿到手即可作为绝佳的高分参考模板,稍作替换个性化润色即可极速完稿,彻底解决写论文难的痛点。 双源硬核解题代码(PythonMATLAB双版本) 拒绝假代码:提供底层逻辑清晰、模块化设计的全套可运行源码。 全流程覆盖:涵盖从前期数据清洗预处理,到中期核心数学模型训练,再到后期启发式算法寻优。 傻瓜式运行:代码自带详尽的逐行中文注释,并支持一键生成高质量结果可视化图表,编程小白也能轻松复现二次开发。 全量数据结果展示表 所有中间处理数据、模型输出参数以及最终结论,均已精细整理成高质量表格。直观呈现性能评估指标多模型对比分析,可直接作为论文正文或附件使用,极大提升学术说服力。 独家硬核思路解析 深入浅出剖析出题人意图,详细拆解每一小问的数学本质底层逻辑,让你不仅知其然更知其所以然。 【四大核心产品优势】 高效实用:所有代码论文均经过严格测试,确保结果精准无误、完全可复现,省去熬夜试错的时间。 全栈覆盖:从思路分析到跑出结果,再到写出高质量论文,提供一站式全流程资料矩阵。 排版辅助:资料内提供专业的论文排版一键转换工具官方标准模板,告别格式调整的繁琐。 持续迭代:网盘直发,开赛后资料库将持续滚动更新,所有用户均可免费同步获取最新包。 【适用人群】 想要打破建模瓶颈的参赛队长主攻手;急需高质量底层代码的编程小白;目标直指特等奖需要高分模板对标的精英团队。
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值