- 博客(70)
- 资源 (10)
- 收藏
- 关注
原创 《ReAct 模式:让 AI 先想再做,边做边想》
它的核心思想很简单:让 AI 不要一上来就瞎答,而是像人一样,边想、边做、边看结果,再继续想,直到把问题解决。简单问题还行,但遇到需要最新信息、复杂计算、查数据库、调用 API 的任务,就容易出问题:可能知识过时,可能算错,也可能一本正经地胡说八道。面对复杂任务时,ReAct 让 AI 不再靠猜,而是靠查、靠算、靠反馈,一步一步把问题解决掉。它更慢,也更贵,但更可靠,过程更可解释,适合复杂任务。ReAct 的本质,是把大模型从“只会说的答题机器”,变成“会使用工具的问题解决者”。最终回答:“建议带伞。
2026-09-15 22:55:40
233
原创 RNN 是个啥?一个“边读边记小本本”的神经网络
比如正确答案是“苹果”,模型给“苹果”的概率只有 0.1,给“飞机”的概率却有 0.6,那损失就很大。重要的“书”“食堂”“吃了”一直留着;但结合前面的“去超市”“买了”,你大概率猜“苹果、香蕉、面包”,不会猜“飞机”。比如它一眼看到“吃了”和“苹果”关系强,“今天”和“苹果”关系弱。它大概率会跳出“苹果”“米饭”“面条”,而不是“飞机”“汽车”“石头”。你看,它不是只看“一个”,而是记得前面有“食堂”“吃了”,所以猜食物。如果只看“两个”,你猜“苹果”可以,“飞机”也可以,“汽车”也可以。
2026-09-15 07:06:08
259
原创 反向传播算法:用如何做好一杯奶茶讲清楚
这就是链式法则:最终误差对某个参数的敏感度,等于误差对输出的敏感度,乘以输出对中间层的敏感度,再乘以中间层对该参数的敏感度。第四步,更新参数,调整配方。但现代网络有百万、十亿级参数,这种做法等于一台收音机有十亿个旋钮,你一个一个试,试到宇宙毁灭也调不完。反向传播,就是神经网络做完题对完答案后,从最终错误倒着追责到每一个参数,算出谁该改、往哪改、改多少,然后一次性调整所有旋钮。前向做一杯,反向追责任,优化调配方,反复迭代,直到出错越来越少。层数很深时,梯度连乘可能导致梯度消失,前面层梯度趋近零,几乎学不动。
2026-09-14 08:49:21
193
原创 一文看懂MoE架构:AI 的专家门诊,又大又省
MoE 不是让一个全能大脑干所有活,而是开一家“超级专家医院”,每次来病人,只叫最相关的几个专家会诊。它可能学会按语言分、按主题分、按句法分,也可能学到一些人类看不懂的规则,比如按位置、标点、高频词分。对应到 MoE:专家数、Top-k、容量因子、辅助损失权重、路由温度等超参特别多,调不好效果差很多。要定:几个专家、每次叫几个、每个专家每天看多少、怎么惩罚偏心、分诊台多大胆、加多少噪声……在相近算力预算下,MoE 可以拥有更大的总参数量、更大的知识容量,可能变得更强。专家一变,路由又可能改主意。
2026-09-14 08:30:38
155
原创 自注意力机制:Q 是纸条,K 是标签,V 是正文
自注意力就是让每个词在句子这个图书馆里,用自己的 Q 去匹配所有词的 K,按匹配度借阅它们的 V,从而读懂上下文。每个词都拿自己的 Q,去全句图书馆里匹配所有词的 K,按匹配度借阅它们的 V,最后更新自己。它想搞清楚自己在这句话里的意思,于是派出一个“找书人”,拿着一张小纸条去图书馆里找相关书。即使“它”和“苹果”隔得很远,也能直接建立联系,不像 RNN 容易忘。我要重点读“吃”这本书,顺便读一点“小明”“门口”,少读“银行”。比如“苹果”问:我该关注“吃”“银行”“小明”还是“门口”?
2026-09-14 07:59:54
166
原创 Deepseek Harness的四种模式
极简模式(重点):只发一把瓦刀和泥抹子去考试。只留最基础工具(shell+文件编辑)。工具最烂还能干好,才证明师傅底子硬。所以最适合测AI的“裸实力”(基准测试)。日常干活用大工(标准);一次性复杂活让包工头写流水线(PTC);扒光高级工具只给瓦刀泥抹子(极简)去裸考,才能测出真本事;最后自己打铁搞发明(创造)。· PTC模式:包工头写死流水线图纸。按个钮,复杂活儿一口气干完,不用盯。· 创造模式:老师傅自己打铁造工具。自己搞发明,升级干活套路。标准模式:全能大工。工具配齐,日常啥都能干。
2026-09-13 22:12:21
236
原创 文本检索与答案检索
语义检索可以做语义相似度的计算,可以处理一词多义,要先做文本嵌入,然后在做相似度计算,可以结合在一起;结合BM2.5和相似度计算;用结巴对输入的问题和内容进行分词,fit可以提取单词的词典大小和IDF的大小。编码完成之后,做归一化,便于后面相似度计算,将相似度转为同一个空间内。有了相似度之后,进行一个排序,就可以通过提问找到比较相似的页面。对分词完的内容提取TFIDF,对提问和每一页的内容进行编码。2.对包含查询内容的文档去进行打分,2.5是打分算法。不仅仅考了的TF和IDF,也考虑 了文本的长度。
2024-07-18 07:55:33
500
原创 Chatgpt和GLM api的使用
2.functions:判断用户1和用户2的关系,function,要调用哪个函数,非常有用的功能,可以对文本进行理解,而且可以将文本转为函数的调用。1.embedding模型,gpt和glm不一样。
2024-07-18 07:26:31
377
原创 动手学RAG:Part1 什么是RAG?
2、大模型的结构和参数数量导致对其修改、微调和重新训练变得很困难。1、大模型的幻觉问题、时效性问题、数据安全问题。3、基于知识的问答,依赖于信息抽取。
2024-07-17 13:08:28
373
原创 知识的向量表示
9、一对多、多对一如何捕捉?知识逻辑复杂,训练代价和语料不充分?7、onehot很难计算出词的隐藏关系,所以从词嵌入过渡到知识图谱嵌入。4、CBow,通过前面几个词和后面几个词,预测中间几个词。3、词的语义由什么决定?词由他的上下文决定?5、skip-gram,通过中间几个词,预测后面几个词。6、本质都是上下问贡献的来决定词的意义,词的分布式语义。8、知识图谱嵌入模型,TransE\DisMult。2、bag词袋模型,无法表示词的语义。1、one-hot表示,空间太大。10、知识表示是传统AI的核心。
2024-07-08 08:00:19
442
原创 知识图谱的符号表示
7、属性图、RDF\三元组、关系图。3、属性图表示方法的优点和去点。1、基于图的表示建模。5、OWL,本体语言。6、OWL有很多家族。
2024-07-08 07:45:45
305
原创 【百问大模型02】一文讲透RAG实战全解析
11、向量检索:query和知识可以通过相似度向量比较检索,搜索一些top的结果,可以加一下文本规则的限制,提升精准度,得到召回来的知识;对找回来的知识进行排序,把用户的问题,召回来的知识,给他下个模型,输出0和1,0表示不相关,1表示相关强烈,然后对输出的结果进行排序,输出检索的结果;知识图谱,召回一个知识,也把另外一个知识给召回,知识构建、维护成本很高,好用但是慎用;14、对用户的问题,进行优化,比如用大模型来扩展问题HyDE,利用大模型来做假答案,取向量平均值;:推理能力,聪明,知识;
2024-06-23 23:55:41
555
原创 【百问大模型01】GPT4o最新特性介绍
3)调用工具的能力,发布了多模态模型,如阅读理解;不但理解公式、还知道公式是干吗用的;======================PPT素材==================端到端能力300ms;之前是语音转成文字,再来理解分析;4)网页解析的能力,换一个网页转成html文件;今年开始专向小模型发挥极致,尤其显卡不好买的情况下;1) RAG最需要的就是大模型的长文本能力,2)强调了智能体,发力智能体,很不错的;2)理解语音内外的内容。3)发出非语音的声音。4)自然而及时的互动。
2024-06-22 22:52:20
600
原创 从0开始搭建清华ChatGLM3 6b大模型(Windows RTX4090版)
本文基于RTX4090 从0开始搭建清华chatglm3,相当基础
2024-01-02 23:59:59
4893
1
原创 【AI】Windows配置GPU Cuda驱动和Pytorch框架
在进行AI项目开发的时候,经常要在GPU环境中运行代码,对于没有配置过的新人来说,还是有点复杂的,本文简单总结在Winddows环境种配置的全过程,适合新手入门,仅供大家参考。
2023-01-20 21:45:10
3235
1
翻译 【AI】反向传播的基本原理(06)
反向传播,也叫误差反传,用误差修正网络中的参数,修正的是权重参数、偏置参数。神经网络就是看你权重和偏置准不准,如果准,预测结果就好些。神经网络的中心任务,就是找到权重、偏置的值,那我们应该怎么找呢
2022-05-30 00:08:21
2597
原创 【AI】梯度下降的数学原理(05)
函数在某一点出沿着不同的方向运动,函数值的变化率是不同的,梯度可以定义为一个函数的全部偏导数构成的向量。梯度向量的方向是函数值变化率最大的方向。也就是对函数的某个特定点,函数值变化最迅猛的地方。
2022-05-30 00:01:37
1698
原创 【AI】神经网络算法的本质(04)
神经网络的输入数据,都有他自己的特征,如何提取出这些特征,并将它用好这个特征,是我们需要关注的。其实AI最核心的,也是怎么利用这些特征,来求得权重参数。是通过调大、还是调小,调试的结果对结果有什么影响,这个是我们要学习的
2022-05-29 23:57:59
1591
原创 【AI】当传统算法碰到计算机视觉(03)
计算机视觉的任务,其实是个哲学问题:我是谁?而你!又是谁?这是个分类问题。尽管深度学习的内部过程中,提取特征是个黑盒子,但是,我们学习过程中还是要了解里面发生了什么才行,要清楚深度学习做分类任务的原理
2022-05-29 23:53:10
474
原创 【AI】人工智能学习之神经网络(02)
神经网络不是算法,而是一种特征提取的方法,现在建模拼的不是算法,而是数据;传统的机器学习(范畴:AI>机器学习>深度学习)的基本步骤如下,这些环节里面最难的是特征工程。
2022-05-29 23:45:53
613
原创 1、软考项目管理考情分析
目录一、学习思路二、上午题考情分析1、非项目管理知识2、项目管理知识三、案例题考情分析四、论文题考情分析五、学习计划1、第三版教程做预习,精读教材2、做最近2年的真题3、论文要准备素材,多写一、学习思路1、有些想法可以复制,有些经验是不可以复制的,主要还是积累自己的学习过程。2、书山有路勤为径,学习课程有80个小时3、打好基本功,一定要利...
2019-07-03 10:04:41
357
原创 资料|云计算之PaaS经典案例-上篇+中篇
由梅峰谷云计算小组整理的PaaS相关资料,目前已经上传到百度云盘和群里,有需要的朋友请入群下,信息爆炸的时代,PaaS资料多但是优质的却有限,云小组从中选取了一些经典有用的汇编成册,仅供参考。
2017-10-16 09:32:23
5002
2
原创 【spark你妈喊你回家吃饭-05】RDD编程之旅基础篇-01
RDD是spark特有的数据模型,谈到RDD就会提到什么弹性分布式数据集,什么有向无环图,本文暂时不去展开这些高深概念,在阅读本文时候,大家可以就把RDD当作一个数组,这样的理解对我们学习RDD的API是非常有帮助的。本文所有示例代码都是使用scala语言编写的
2017-06-16 17:54:50
989
原创 【Spark你妈喊你回家吃饭-04】再说Spark底层运行机制
Spark通过RDD对分布式的数据进行管理,RDD记录了转换成“spark格式”后的数据分区(记录数据的存储位置)和数据分区对应的操作 · 应用提交后,形成RDD Graph,并且在后台创建DAG对象(spark不仅仅用DAG建模,而且还会执行它,并且里面不是用对象表示,而是用RDD对象之间的关系)
2017-02-14 23:58:11
1653
原创 【Spark你妈喊你回家吃饭-03】Spark RDD的蛮荒世界
RDD真的是一个很晦涩的词汇,他就是伯克利大学的博士们在论文中提出的一个概念,很抽象,很难懂;但是这是spark的核心概念,因此有必要spark rdd的知识点,用最简单、浅显易懂的词汇描述。不想用学术话的语言来阐述RDD是什么,用简单、容易理解的方式来描述。
2017-02-14 23:45:23
1007
原创 【Spark你妈喊你回家吃饭-02】-我是一个凶残的spark
学一门新鲜的技术,其实过程都是相似的,先学基本的原理和概念,再学怎么使用,最后深究这技术是怎么实现的,所以本章节就带你认识认识spark长什么样的,帅不帅,时髦不时髦(这货的基本概念和原理),接着了解spark有什么必杀技(spark的各种大招),我们如何使用它的必杀技,最后看看spark如何更加高效的组合它的必杀技,以及spark是如何练就这一身必杀技的。
2017-02-14 23:38:05
1101
原创 【Spark你妈喊你回家吃饭-01】 Spark是什么鬼?
经过一段时间的学习和测试,是时候给spark的学习经历做一个总结了,对于spark的了解相对晚了写。本博准备推出20篇左右spark系列原创文章(先把牛吹出去再说) ,尽量将枯燥无味的技术讲的通俗易懂- r.kelly
2017-02-12 09:50:34
3301
2
原创 分享一个Java和Android学习视频
和许多网友交流,大家都在感慨学了很多时间的java,但是总感觉java是如此的神秘,能够感觉到他的存在,但却不能体会到他的真正要意,能够看明白代码,却不能写出自己的代码!!!其实说白了,大家都还木有入门,一旦入门了,这些问题都不是问题,学习java有些东西是必须掌握的,有些东西是知道他存在即可的,有些东西是过一遍就可以的,有些东西是完全没有必要去看的,碰到了百度就可以.java不难学,有些东西一定
2016-05-04 15:22:03
799
原创 Hbase课程02- Hbase shell命令总结
1、前言 对hbase的操作使用最多的两种查询方式一个是shell命令,在项目开发中临时查询经常使用,还一个是Hbase Java API的使用,代码开发过程中常用。重用shell命令名称命令表达式创建表create '表名称', '列名称1','列名称2','列名称N'添加记录
2016-03-29 21:56:17
589
原创 本周总结
本周主要工作还是集团DPI与DDR比对工作、工信部日志留存及拨测工作、流量查询系统工作、运维工作,工作很忙,被很多杂事束缚住了手脚,没有时间学习,很郁闷。 目前团队管理和开发都存在很多问题 (1)管理方面,大家都很累,工作无效率,办事无规章,尤其是很多临时取数的需求,很恶心,都是一些无效率的取数 数据分析人员思维比较固定,不学习新东西
2016-03-25 18:14:30
435
原创 Hbase课程01- 和Anmy学习大数据
1、初识Hbase · 稀疏、分布式、持久化 ,KV存储,随机访问随机存储的平台 · 无关系性数据库那样的模式,无sql,无跨行事务,不强调数据之间的关系 · 集群运行,也可以单台机器,横向扩展能力强,存储、缓存、计算能力多台机器提供2、说说传统数据库 不可否认,传统关系型数据库在数据存储、服务和处理上的巨大成功,sql ser
2016-03-25 16:22:54
600
原创 Hive基础知识
1.hive特别适合数据仓库程序,对于数据仓库程序不需要实时响应查询,不需要记录级别的插入、更新和删除2.hive实现word count程序
2014-08-22 14:52:25
792
原创 hbase Web UI中的一些零碎
hbase master默认端口:60000,http://jxdream1:60010/master-statusregion服务器的默认端口:6000
2014-07-23 17:34:57
10979
转载 15个构建交互式图表的最佳jQuery插件
发表于 2013-06-23 22:40 来源:开源中国社区 阅读: 1250次在这篇文章中,我们向你推荐 15 个图表库,包含从简单图表实现到高度复杂的交互式图表,希望你会喜欢。1. Chart.js : Charting Library with HTML5 Canvas 使用HTML5 Canvas元素的Javascript图形库,支持6种统计图形,不依赖其他库.
2013-07-31 17:38:07
1601
贪吃蛇源代码JAVA
2011-07-15
resource.xml
2011-11-01
javabijiben
2011-10-05
struts资源需要的包
2011-10-07
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅