标签: AI工具

  • Google 发布 AI 图像创意工具「Whisk」

    Google 发布 AI 图像创意工具「Whisk」

    在人工智能技术飞速发展的今天,Google 再次带来惊喜。Google Labs 正式推出了一款名为 Whisk 的创新型 AI 图像生成工具,这款工具彻底颠覆了传统以文本提示为核心的创作方式,转而采用图像驱动的全新交互模式。

    什么是 Whisk?

    Google Whisk AI图像工具

    Whisk 是 Google Labs 推出的一款创新 AI 图像生成工具,它通过图像输入快速生成并重混创意图片。与传统 AI 绘图工具不同,Whisk 允许用户上传图像来确定主体、场景和风格,无需撰写复杂的文本提示,为不擅长文字描述的用户提供了更便捷的创作方式。

    核心功能特点

    • 图像驱动的生成:上传图像即可确定创作主体、场景和风格,无需编写文本提示
    • 自动生成详细字幕:Gemini 模型会自动为上传的图像编写详细的字幕描述,精准捕捉图片的主题、情感和风格特征
    • 创意重新混合:可将不同的主体、场景和风格图像进行重新混合,创造出独特设计,如数字玩偶、珐琅别针等创意产品
    • 本质捕捉而非复制:捕捉输入图像的本质特征,而非精确复制,为创意变化提供更多空间
    • 可编辑提示:用户可查看和编辑底层提示信息,自由调整颜色、图案等特征

    技术原理揭秘

    Whisk 的强大能力源于 Google 两大核心技术的协同工作:

    1. Gemini 视觉理解与描述模型:负责为用户上传的图像生成详细的文字描述,精准捕捉图片的主题、情感和风格特征
    2. Imagen 3 图像生成模型:基于 Gemini 生成的丰富描述信息,运用深度学习算法创造出符合用户意图又充满惊喜的新图像

    适用场景

    Whisk 主要定位于创意探索领域,旨在帮助用户快速生成和迭代各种创意想法,而非用于精确的图像编辑。无论是数字艺术品创作、产品设计灵感,还是创意概念探索,Whisk 都能提供独特的帮助。

    工具地址

    • 官方博客:https://blog.google/technology/google-labs/whisk/
    • 使用地址:https://labs.google/fx/zh/tools/whisk

    注意事项:目前 Whisk 仅对美国用户(美国 IP)开放,其他地区用户可能无法直接访问。

    Whisk 的推出标志着 Google 在图像生成领域的重要布局,这款工具不仅简化了图像创作流程,更在技术上实现了质的飞跃,为用户提供了一种独特的图像生成方法。

  • CAPTCHA-automatic-recognition:AI 驱动的验证码自动识别脚本

    CAPTCHA-automatic-recognition:AI 驱动的验证码自动识别脚本

    CAPTCHA-automatic-recognition AI验证码自动识别工具

    工具介绍

    CAPTCHA-automatic-recognition 是一款 AI 驱动的验证码自动识别与填充脚本。它通过人工智能模型对网页验证码进行自动识别,并将识别结果直接填入输入框。该脚本支持 OpenAIGemini 以及 阿里云通义千问 等主流 AI 服务,用户也可以自定义 API 地址和模型。配置一次后,即可在所有网站通用,无需反复设置。

    功能特点

    • 自动识别与填充:自动识别网页验证码,并将结果直接填入输入框,减少手动输入的繁琐操作。
    • 支持主流 AI 服务:支持 OpenAI、Gemini、阿里云通义千问等主流 AI 服务,用户可以根据需求选择合适的 AI 模型。
    • 自定义 API 地址和模型:用户可以自定义 API 地址和模型,满足个性化需求。
    • 通用配置:配置一次后,即可在所有网站通用,无需反复设置,提升使用效率。

    使用场景

    • 在线注册与登录:在需要验证码的在线注册或登录场景中,自动识别验证码并填充,提升用户体验。
    • 自动化测试:在自动化测试中,快速识别验证码,确保测试流程的顺利进行。
    • 数据采集:在数据采集过程中,自动识别验证码,提高数据采集的效率和准确性。

    安装与使用

    安装方法

    1. 在浏览器中添加 TampermonkeyViolentmonkey 扩展
    2. 访问脚本安装地址并完成安装

    使用方法

    1. 打开任意含验证码的网页
    2. 点击验证码图片右侧的小图标
    3. 首次点击时会弹出设置面板,输入 API Key 并选择模型
    4. 保存后即可开始单击识别,也可在设置中勾选“验证码变化时自动识别”
    5. 对于使用前端框架模板的网站,可启用“自动复制到剪贴板”以确保识别结果有效

    工具地址

    GitHub:https://github.com/XiaomingX/openai-captcha-detection

    安装链接:CAPTCHA-automatic-recognition(AI 验证码自动识别填充)

  • GPTalk v4.0.1.0(89) 安卓绿化版

    GPTalk v4.0.1.0(89) 安卓绿化版

    软件介绍

    GPTalk是一款多功能的AI驱动沟通和生产力工具,它利用ChatGPT技术为用户提供智能对话、语言翻译、笔记记录和内容创作等服务。以下是GPTalk的一些核心功能和特点:

    1. 智能对话:GPTalk可以创建和切换不同话题的对话,提供自然和相关的回答。
    2. 语言翻译:它通过AI技术促进全球沟通,打破语言障碍。
    3. 笔记记录和内容创作:GPTalk提供AI辅助的笔记记录和内容创作功能,提高个人和企业的生产力。
    4. 多平台支持:GPTalk支持在多个平台上使用,包括移动设备和电脑。
    5. 自定义聊天界面:用户可以享受自定义的聊天界面和多语言支持。
    6. AI辅助写作:跨多种平台的AI辅助写作功能,帮助用户更高效地创作内容。
    7. 个性化角色生成:GPTalk允许用户根据需求打造心理咨询师、侦探等虚拟角色,无需上传照片,通过文字描述进行定制。
    8. 上下文对话:GPTalk能够理解上下文,在对话中自动获取相关信息,更准确地回答问题。
    9. 语音激活的AI:GPTalk使用OpenAI的ChatGPT和Picovoice的Porcupine响应语音命令和问题。
    10. 文本到语音和语音到文本:GPTalk提供文本到语音和语音到文本的功能,方便用户在不同场景下使用。

    GPTalk通过其多功能性和AI驱动的特性,成为了个人和专业使用的宝贵工具,节省时间并提高沟通和内容创作的质量

    版本特色

    去广告,解锁功能

  • Google 发布旗下最强 AI 大模型「Gemini 2.0 Flash」

    Google 发布旗下最强 AI 大模型「Gemini 2.0 Flash」

    2024年12月,谷歌正式发布了旗下最新人工智能模型——Gemini 2.0 Flash。作为 Gemini 2.0 系列的首个模型,它在多模态处理和 AI Agent 方面实现了重大突破,标志着谷歌在人工智能领域迈入新阶段。

    工具介绍

    Gemini 2.0 Flash 是谷歌最新发布的人工智能模型,它是 Gemini 2.0 系列的首个模型,具有以下特点和功能:

    1. 多模态输入输出

    Gemini 2.0 Flash 支持图片、视频和音频等多模态输入,并且能够进行多模态输出,例如直接生成图像与文本混合的内容,以及原生生成可控的多语言文本转语音(TTS)音频。

    2. 性能提升

    与上一代模型 Gemini 1.5 Flash 相比,Gemini 2.0 Flash 在关键基准测试中的表现是 1.5 Pro 版本的两倍之快。

    3. 原生工具调用

    Gemini 2.0 Flash 可以原生调用谷歌搜索、代码执行以及第三方用户定义的函数等工具。

    4. 智能体时代

    谷歌 CEO 桑达尔·皮查伊表示,如果说 Gemini 1.0 的作用是整合和理解信息,那么 Gemini 2.0 能够做到让信息更加有用,为构建通用助手的愿景更进一步。

    5. AI Agent 功能

    Gemini 2.0 系列模型主打 AI Agent 功能,在原本的功能之外,还加入了多项新的 Agent 功能。

    6. 开发者体验

    从发布之日起,2.0 Flash 的实验版本将通过 Gemini API 和谷歌的 AI 开发平台(AI Studio 和 Vertex AI)提供。然而,音频和图像生成功能仅对“早期接入合作伙伴”开放,并计划在明年1月全面推出。

    7. 新输出模式

    开发人员将能够使用 Gemini 2.0 Flash 生成集成响应,这些响应可以包含文本、音频和图像 — 只需调用一次 API 即可完成。

    8. 多模态实时 API

    谷歌推出了新的多模态实时 API,支持实时音频和视频流输入,并能同时使用多个组合工具,为用户带来更加丰富的交互体验。

    9. 智能体研究原型

    谷歌还展示了三个智能体研究原型:Project Astra、Project Mariner 和 Jules,展现了智能体如何改变我们与数字世界的互动方式。

    核心功能一览

    • ✅ 生成图像和音频
    • ✅ 网页搜索
    • ✅ 代码编写
    • ✅ 游戏指导
    • ⏳ 图片和语音生成功能将于明年1月开放

    Gemini 2.0 Flash 的发布标志着谷歌在人工智能领域的进一步发展,特别是在多模态处理和智能体技术方面。

    工具地址

    • 🌐 官方博客:Google AI 官方博客
    • 🚀 直达链接:Gemini 官网
  • 5ire – 开源跨平台大语言模型桌面客户端

    5ire – 开源跨平台大语言模型桌面客户端

    工具介绍

    一款跨平台 LLMs 桌面客户端,支持 OpenAI、Azure OpenAI、Anthropic、Google、百度、探月、豆包、Grok、DeepSeek 和 Ollama。 软件将 bge-m3 集成为本地嵌入模型,支持 DOCX、XLSX、PPTX、PDF、TXT 和 CSV 文档的解析和矢量化,从而能在本地支持强大的检索增强生成 RAG 功能。 支持本地知识库、使用情况分析、提示库、书签、快速关键字搜索。 支持平台:#Windows #macOS

    工具地址

    官方地址:

    https://5ire.app/

    GitHub:

    https://github.com/nanbingxyz/5ire

  • NSFW Detector – 基于 AI 的 NSFW 内容检测器

    NSFW Detector – 基于 AI 的 NSFW 内容检测器

    NSFW Detector 工具界面

    工具介绍

    NSFW Detector 是一款基于 AI 人工智能技术的内容检测工具,专门用于识别和过滤不适当内容(Not Safe For Work)。相较于传统的 NSFW 检测工具,它具有更强大的功能和更好的使用体验。

    核心功能

    • 多格式支持:支持检测图片、PDF、视频、压缩包中的文件
    • 本地推理:支持在本地纯 CPU 环境下进行推理,无需 GPU 加速
    • 隐私保护:所有检测在本地完成,数据不会上传到服务器

    工具地址

    • 中文指南:https://github.com/tmplink/nsfw_detector/blob/main/README_cn.md
    • 网站:https://www.vx.link/nsfw_detector.html
    • GitHub:https://github.com/tmplink/nsfw_detector
  • Text Behind Image – 开源在线图片设计工具 轻松创建图像设计背后的文字

    Text Behind Image – 开源在线图片设计工具 轻松创建图像设计背后的文字

    Text Behind Image 工具界面

    工具介绍

    Text Behind Image 是一款开源在线图片设计工具,可以让你神奇地将文字置于照片主体背后的工具。它允许用户在图片中的角色或主体背后添加文字,创建具有视觉冲击力的海报和社交媒体图像。

    用户可自定义文字样式,包括字体、颜色、位置、不透明度等,并能快速将设计分享到社交媒体。工具由年仅 16 岁的开发者 Rexan Wong 创建,基于 Next.js 框架开发,结合前端技术(如 Canvas 和 SVG)实现图像处理,提供流畅的用户体验。

    代码已公开在 GitHub 上,适合设计师和内容创作者使用。

    工具地址

    • 地址1:https://textbehindimage.rexanwong.xyz
    • 地址2:https://textbehindimage.app
    • GitHub:https://github.com/RexanWONG/text-behind-image
  • Text Behind Image – 一键生成海报级别的图片

    Text Behind Image – 一键生成海报级别的图片

    Text Behind Image 是一款基于 AI 技术的在线图片处理工具,能够帮助用户轻松生成海报级别的精美图片。

    工具介绍

    只需上传一张图片,然后 AI 会对图片做一些处理,然后添加任意文字,最后一张精美的海报级别图片就出来了!

    对比用 PS 做能节省不少时间,非常适合需要快速制作宣传图、海报的用户。

    效果预览

    Text Behind Image 工具界面

    工具地址

    地址:https://textbehindimage.rexanwong.xyz/

  • Screenshot to Code:将任何屏幕截图或设计转换为干净的代码

    Screenshot to Code:将任何屏幕截图或设计转换为干净的代码

    在现代前端开发中,将设计稿快速转换为代码一直是开发者的核心需求。Screenshot to Code 是一款基于先进 AI 技术的开源工具,能够将屏幕截图、设计稿和 Figma 设计自动转换为干净、可用的代码,显著提升开发效率。

    工具介绍

    Screenshot to Code 利用人工智能技术将屏幕截图、设计稿和 Figma 设计转换为干净、实用代码的开源工具。以下是该工具的主要特点和功能:

    🤖 AI 技术支持

    Screenshot to Code 使用了先进的 AI 模型,包括 Claude Sonnet 3.5 和 GPT-4O,来生成高质量代码,确保转换结果的准确性和可读性。

    💻 多种前端技术栈支持

    该工具支持多种主流前端技术栈,满足不同项目需求:

    • HTML + Tailwind
    • HTML + CSS
    • React + Tailwind
    • Vue + Tailwind
    • Bootstrap
    • Ionic + Tailwind
    • SVG

    🎨 图像生成能力

    除了代码生成,Screenshot to Code 还可以使用 DALL-E 3 或 Flux Schnell 进行图像生成,以 10 倍速度构建用户界面。

    ✨ 核心优势

    • 高效便捷:通过截图生成代码,避免传统编程中繁琐的手写过程,极大提高编程效率
    • 智能优化:生成的代码经过优化,不仅可读性强,而且运行效率更高
    • 易于上手:操作简单,无需额外学习复杂的编程知识和技能,即可快速上手
    • 应用场景广泛:适用于快速原型实现,设计师可以快速将设计稿转化为可运行的代码

    📦 开源项目

    Screenshot to Code 是一个完全开源的工具,在 GitHub 上已获得超过 53,000 颗星,深受领先公司的开发人员和设计师欢迎。

    💾 本地部署支持

    用户可以选择将该项目在本地电脑上部署,以便在自己的计算机上运行,这为那些希望在本地环境中使用该工具的用户提供了极大的便利。

    工具地址

    🌐 官方网站:https://screenshottocode.com/

    💻 GitHub 仓库:https://github.com/liseami/screenshot-to-code

    总结

    Screenshot to Code 是一个强大的 AI 驱动工具,它通过自动化的方式将设计图转换为代码,显著提高了前端开发的效率。无论是在线使用还是本地部署,它都为用户提供了灵活、高效的代码生成解决方案。此外,通过提供编辑功能和代码导出,它满足了用户对代码调整和个性化的需求。

  • Grok发布自回归图像生成模型「Aurora」

    Grok发布自回归图像生成模型「Aurora」

    Aurora 是由 xAI 推出的新一代自回归图像生成模型,现已正式发布。该模型支持多模态输入,能够生成高质量的文字、表情包、人物肖像等多种类型的内容。

    核心功能

    • 多模态输入支持:支持文本、图像等多种输入方式
    • 多样化内容生成:可生成文字、表情包、肖像等多种类型
    • 智能提示词编辑:通过自然语言描述进行图像编辑和调整
    • 快速开放:官方承诺一周内对所有用户开放使用

    工具地址

    访问入口:https://x.com/i/grok

    官方博客:https://x.ai/blog/grok-image-generation-release

    注意:访问需要国外IP地址。

    使用说明

    用户可以通过 x.com 平台直接访问 Grok,使用提示词描述你想要的图像内容,Aurora 将自动生成对应的图像。支持对生成结果进行进一步的提示词编辑和调整。