TGViewer
Channel Public Channel
GitHub开源观察|开源项目·热门仓库·开发者

GitHub开源观察|开源项目·热门仓库·开发者

@githubtrendinghub

每日追踪 GitHub 热门与新锐开源项目,第一时间发现值得 star 的好轮子。投稿 @BDHT1
#GitHub #开源 #编程 #开发者
Subscribers
669
Photos
811
Videos
0
Links
417

Showing posts older than #595 · Back to latest

Older Posts 11 shown
Post #594 12
IBM 报告:AI 驱动攻击占恶意泄露四分之一

IBM《2026年数据泄露成本报告》显示,在恶意数据泄露事件中,AI 驱动的攻击占比达四分之一,较去年增长 56%。此类事件单起平均造成 600 万美元损失,比全球数据泄露事件平均成本(499 万美元)高出约 100 万美元。

报告指出,攻击手段以深度伪造冒充身份和 AI 驱动的恶意软件为主,正在改变数据泄露的经济影响格局。对安全团队而言,这意味着防御端同样需要引入 AI 手段来应对攻击规模与速度的升级。

#GitHub #开源 #AI安全 #数据泄露 #IBM #网络安全 #深度伪造
@GitHubTrendingHub
Post #593 13
ShopXO 商城发布 v6.9.1 更新

ShopXO 免费开源商城系统发布 v6.9.1 版本。本次更新主要新增四款实用插件,面向使用 PHP 8.0 及以上环境的商城开发者与运营者。

新增 OSS 文件插件,支持图片样式处理;朋友代付插件适配移动端,支付弹窗预留钩子,附带支付单号记录与权限管控;商品 Excel 导入插件支持多商户记录、规格图及多层规格批量导入;代客下单插件可留存下单记录、支持再次付款,并统一捕获展示异常报错。

本次为功能增量更新,不涉及破坏性变更。使用 ShopXO 的开发者可关注官方仓库获取更新详情。


#GitHub #开源 #ShopXO #PHP #电商 #商城系统
@GitHubTrendingHub
Post #592 14
Qualia 开源:面向 Java 开发者的 AI Agent 框架

Qualia 是一套为 Java 生态量身定制的 AI Agent 框架,并非简单的“Java 版 LangChain”。它深度结合 Java 语言特性,采用模块化设计,主打生产环境友好。项目团队基于多个企业级 AI 落地项目经验,针对模型 API 各异、工具集成散乱、会话状态难管理、提示词无法复用、知识检索重复造轮子等常见痛点进行设计。

框架的核心价值在于让 Java 开发者无需切换技术栈即可构建智能体应用,直接复用现有 Java 工程体系与工具链。相比在 Java 项目中强行引入 Python 系框架,Qualia 在类型安全、依赖管理和部署运维上更贴合 Java 生态习惯。

本次开源发布主要面向需要将 AI 能力集成进现有 Java 服务的企业开发团队。如果你正在评估 Java 生态下的 Agent 开发方案,或受困于多模型接入与工具调用的碎片化问题,Qualia 提供了一个统一抽象层的选择。项目已托管至 GitHub,可查看源码与文档进一步了解其模块划分与快速上手方式。


#GitHub #开源 #Qualia #Java #AI #Agent #LLM
@GitHubTrendingHub
Post #591 12
Semaphore:纯浏览器端图片转 ASCII 工具

开发者用 TypeScript 和 Canvas 构建了 Semaphore,一个完全在浏览器标签页内完成图片转 ASCII 转换与导出的开源工具。与多数同类工具需要上传图片不同,Semaphore 的整个处理流程不离开本地设备,适合处理截图、私人照片、图表等不便上传的内容。

项目无应用框架、无运行时依赖,转换路径为:图片 → Canvas 采样 → 亮度网格 → 字符映射 → 文本或 PNG。内置六种字符集预设,包括标准、细节、极简、二进制和盲文模式。盲文模式通过 Unicode 盲文字符(U+2800 起)将 2×4 点阵打包进单个码点,同等宽度下每个单元可表示八个源采样,保留更精细的空间结构;该模式还支持可选的 Floyd-Steinberg 误差扩散抖动,缓解二值化带来的梯度生硬问题。

隐私方面,生产环境响应头携带 connect-src 'none' 的 CSP 策略,禁止页面脚本发起 fetch、XHR 或 WebSocket 连接。项目无后端 API、无客户端分析脚本、无 Cookie、无第三方运行时请求,所选图片字节不会进入任何网络请求。支持纯文本复制、.txt 下载、彩色/灰度输出及 PNG 导出。

项目 MIT 许可,在线工具与源码已公开。


GitHub

#GitHub #开源 #TypeScript #Canvas #ASCII #图像处理 #隐私保护 #Web开发
@GitHubTrendingHub
Post #590 13
Lilian Weng 离开 Thinking Machines 重返 OpenAI

顶级 AI 研究员 Lilian Weng 上周刚宣布因健康原因离开 Thinking Machines Lab,称联合创始人的角色「太累了」。几天后,The Information 曝出她将重回 OpenAI,负责递归自我改进方向的研究。

她是 Thinking Machines 过去一年内第四个离开的联合创始人。这家由前 OpenAI 高管创办的实验室正面临人才持续流失。

Dario Amodei 则担心新人来 Anthropic 只为金钱,不为使命。

#GitHub #开源 #LilianWeng #OpenAI #ThinkingMachines #Anthropic #DarioAmodei #AI人才流动
@GitHubTrendingHub
Post #588 15
腾讯开源团队级 Agent 记忆中枢

腾讯云开源 TencentDB Agent Memory,一个面向 AI Agent 团队的团队级记忆中枢。它把对话、文档和代码沉淀为四类可复用的记忆资产——Chat Memory、Skill、LLM-Wiki 和 Code-Graph,并支持跨 Agent、跨框架的治理、共享与装配。

核心解决的是重复劳动问题:项目上下文不必每次重新解释,文档不必每个 Agent 从头读起,跑通的工作流不必下次重新摸索。新 Agent 团队可以直接导入已有代码库、文档和对话记录,从既有经验起步,而不是从零学习。

四类记忆资产各有分工:Chat Memory 按 L0 对话到 L3 人设分层蒸馏,保留偏好、事实和决策;Skill 把排障、代码评审、发布检查清单这类经验沉淀为带版本和触发边界的可复用技能,默认私有、审核后可共享;Wiki 把产品文档和运维手册变成带链接图的结构化页面;CodeGraph 索引代码符号、调用关系和影响路径,改代码前先做影响分析。

记忆资产与 Agent 框架解耦,可跨框架迁移。Memory Hub 提供权限控制,支持 private、team、restricted 和 agent 四级可见性,资产归属通过 Owner 追踪。官方基准测试中,PersonaMem 场景下 Agent 对用户信息的理解和应用准确率从 48% 提升到 76%。

当前支持 OpenClaw、Hermes、Claude Code、CodeBuddy 及 SDK 集成,更广泛的跨框架迁移在路线图中。CodeGraph 目前优先支持公开 HTTPS 仓库,私有仓库和 SSH 凭据支持仍在完善。


项目采用 MIT 协议,代码参考了 CodeGraph、Hermes Agent 和 Karpathy 的 LLM Wiki 设计。安装可一键启动 memory-core、memory-hub 和 proxy 三个服务,旧版本(v1.x / v0.x)用户可通过迁移工具升级到 v2.0.0+。

GitHub

#GitHub #开源 #腾讯云 #AgentMemory #AI记忆 #多智能体 #LLM
@GitHubTrendingHub
Post #579 14
系统设计面试准备开源指南

准备系统设计面试的经典开源项目 system-design-primer,整理了大规模系统设计的学习资源,涵盖从基础概念到真实架构案例的完整路径。

项目面向准备技术面试的开发者,也适合想系统学习分布式系统设计的工程师。内容包含系统设计主题索引、常见面试题及参考方案、Anki 记忆卡片,并附有学习路线图,可按短期、中期、长期备考时间灵活安排。

核心内容覆盖 CAP 定理、一致性模式、可用性模式、DNS、CDN、负载均衡、反向代理、微服务、数据库扩展(主从复制、联合、分片、反规范化)、缓存策略、异步处理、通信协议(TCP/UDP/RPC/REST)等主题,每个主题都列出优缺点和进一步阅读链接。

面试题部分提供 Pastebin、Twitter 时间线、网络爬虫、Mint.com、社交网络数据结构、搜索引擎键值存储、亚马逊分类排名、AWS 百万级用户系统等经典设计题及讨论、代码和图示。

还收录了 Google、Amazon、Facebook、Instagram、Netflix、Uber、WhatsApp 等公司的真实架构分析文章,以及各公司工程博客链接,方便针对目标公司做定向准备。


项目持续维护、接受社区贡献,已翻译成包括简体中文在内的多种语言,CC BY 4.0 许可。

GitHub

#GitHub #开源 #系统设计 #面试准备 #分布式系统 #架构设计 #Anki
@GitHubTrendingHub
Post #578 12
Firecrawl 开源 Rust PDF 解析库 pdf-inspector

Firecrawl 开源了 pdf-inspector,一个纯 Rust 编写的 PDF 解析库,可在本地快速完成 PDF 分类、文本提取和 Markdown 转换,全程无需 OCR。项目提供 Python、Node.js 和浏览器 WebAssembly 绑定,并附带 CLI 工具。

核心思路是智能路由:先用约 10-50ms 判断 PDF 是文本型还是扫描型,文本型直接在本地提取(约 150ms),只有扫描件才转交 OCR 服务。官方称约 54% 的 PDF 无需 OCR,可显著节省成本与延迟。

主要能力:

• 识别 TextBased
• Scanned
• ImageBased
• Mixed 四类 PDF,返回置信度与逐页 OCR 路由建议;位置感知的文本提取,支持多栏阅读顺序与 RTL;Markdown 转换覆盖标题
• 列表
• 代码块
• 表格
• 粗斜体与链接;表格检测采用矩形与文本对齐双模式,可处理跨页金融表格;支持 CID 字体与 ToUnicode CMap 解码
在 opendataloader-bench 基准(200 份 PDF)中,pdf-inspector 综合得分 0.875,阅读顺序 0.915,表格 0.814,处理 200 份文档耗时 0.470s,均优于 liteparse、opendataloader、pymupdf4llm 与 markitdown。基准于 2026 年 7 月 31 日在 Apple M4 Pro 上刷新。


适合处理报告、论文、金融文档、发票和法律 PDF 等原生文本型文档,输出干净的结构化 Markdown,无需引入 OCR 基础设施。项目以 MIT 协议开源。

GitHub

#GitHub #开源 #pdfinspector #Firecrawl #Rust #PDF解析 #Markdown #WebAssembly
@GitHubTrendingHub
Post #577 12
RAG 成本估算实战:先算 Token 再上线

构建“问答你的文档”类语义搜索应用时,成本控制的关键在于:批量索引文档、上线前估算 Token 消耗、只把检索到的 Top 结果发给模型。作者建议把每个上传文档当作一次摄取任务,分块、生成 Embedding、记录元数据,避免把所有相关片段都塞进答案生成。

成本估算要分开看三块:索引时的 Embedding 输入、检索时的工作量、答案生成的输入输出。Embedding 通常占比不大,真正影响成本的是 chunk 大小、重叠度和 top-k 设置。作者强调,更长的上下文可能救回一个难题,却会让普通问题的花费和 grounding 都变差。

作者还分享了一个教训:一次重复写入恢复时遇到 429,简单重试导致同一写操作执行两次,产生 47 条重复 chunk 记录。因此文档索引的重试必须有幂等键或客户端提供的标识符,不能只靠日志。

作者给出的实践建议包括:先用脚本对语料做粗略 Token 预估,上线前用提供商的 Token 计数接口校准;批量索引适合大文件回填,用队列式工作流并持久化任务 ID;如果用户期望上传后立即可搜索,则需保留同步路径。
在技术栈选择上,作者建议不轻易迁移正在运行的架构:OpenAI 适合已以其 API 为核心的生成流程,Anthropic 和 Google Gemini 适合已在评估其模型的团队,Pinecone 和 Weaviate 适合以专用向量数据库为中心的设计,Infrai 则适合希望用统一 REST API 减少集成数量的应用。
最终评估要综合看 grounded 答案质量、检索召回率、重复写入行为和提示词大小,一个干净的成本估算配上弱检索,只是用更低开销返回无用的答案。


#GitHub #开源 #RAG #Token估算 #Nodejs #语义搜索 #Embedding #向量数据库
@GitHubTrendingHub
Post #576 10
给 Claude 接 Telegram,先分清两种 MCP 服务器

把 Claude 接上 Telegram 只需约五分钟,但选哪种接入方式差别巨大,多数教程不会告诉你其实有两条路。区别核心在于服务器以什么身份登录:Bot API 服务器用 @BotFather 发的机器人令牌,只能看到被明确拉入的群聊,私聊不可见,令牌可随时在 BotFather 一键吊销;MTProto 服务器则用你的手机号登录并保存会话文件,等于以你本人身份运行,所有私聊、群组、收藏消息和联系人全部对代理开放。两者都叫「Telegram MCP 服务器」,但只有一种会交出你的整个账号。

Bot API 方式无需安装,uvx 直接拉取,配置里填 TELEGRAM_BOT_TOKEN 即可;还有更窄的只发不收选项,代理只能向指定聊天推送构建告警和任务结果,不读取任何内容。MTProto 方式需要真实安装并做一次性交互登录,注意环境变量名是 API_ID 和 API_HASH,不是 TELEGRAM_API_ID,写错服务器会直接拒绝启动。

配置文件位置因客户端而异:Claude Desktop 在 ~/Library/Application Support/Claude/claude_desktop_config.json,Cursor 在 ~/.cursor/mcp.json,Windsurf 在 ~/.codeium/windsurf/mcp_config.json,Codex CLI 在 ~/.codex/config.toml 且用 TOML 格式而非 JSON。Claude Desktop 改完配置要彻底退出而非关窗,否则服务器不会生效。

会话文件不是受限令牌,而是活登录态,任何能读到它的人都能读你的 Telegram,且不会像轮换密码那样过期,撤销只能去设备列表终止会话。另一个无需盗窃的风险是:代理既能读消息也能发消息,对 LLM 而言「数据」和「指令」没有结构区别,精心构造的消息就是攻击面,想试的人只需给你发条消息。Bot 令牌的爆炸半径限于机器人所在聊天,会话文件则覆盖整个账号。


MTProto 并非不可用,而是应作为刻意选择而非默认。若确实需要跨全部聊天检索历史,建议用副账号、把会话文件移出仓库和同步目录,并先给代理读权限再给发权限,避免测试期间误发消息给真人。这些服务器都是社区项目,开源好用但无安全审计,接入重要账号前务必读清源码。

GitHub

#GitHub #开源 #MCP #Telegram #Claude #AI代理 #安全 #BotAPI #MTProto
@GitHubTrendingHub
Post #573 14
GNOME 扩展审核被 AI 垃圾淹没,官方改向机器人写说明书

GNOME Shell 扩展通常来自 extensions.gnome.org(简称 EGO),每个提交都会经过人工审核。去年 12 月,GNOME 在审核指南中新增规则,明确禁止完全由 AI 生成、开发者无法解释或调试的扩展,但允许将 AI 用于学习和代码补全。几个月过去,AI 垃圾提交的洪流并未减缓。

上周,当初制定该规则的开发者 Javad Rahmatzadeh 换了个思路:不再事后拒绝劣质提交,而是直接面向生成这些提交的 AI 模型撰写操作说明,试图让机器人“理解”审核标准。目前审核队列仍处于拥堵状态,这一做法能否奏效还有待观察。

对向 EGO 提交扩展的开发者而言,这意味着审核门槛只会更严——提交前请确保自己能完整解释每一行代码。

#GitHub #开源 #GNOME #扩展审核 #AI生成代码 #EGO
@GitHubTrendingHub
Older posts →
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →