Nova Patents
NL2012433B1

Data clustering.

Abstract

The present disclosure describes methods and systems by which memory-efficient clustered data structures of related data entities (or "clusters") may be generated. Generation of clusters may begin by automatic generation of an initial, seed data entity of interest. Clusters of related data entities are generated based on the seed and according to cluster generation strategies (or cluster strategies). Seeds and related data entities may be accessed from various databases and data sources. The data analysis system may bring together data from multiple data sources in order to build clusters.

NL2012433B1, drawing sheet 1
Sheet 1 of 10

Term

7.5 yearsto projected expiry

Projected expiry 14 March 2034, counted from filing; an application has no term until it is granted.

  1. Priority
  2. Filed
  3. Published
  4. Today
  5. Projected expiry

19 claims: 10 independent, 9 dependent

  1. 1
    CONCLUSIES 1. Op een computer geïmplementeerde werkwijze voor het voortbrengen van een cluster met gerelateerde gegevensentiteiten, waarbij de werkwijze omvat:communiceren met één of meer elektronische gegevensopslagen waarin een veelheid gegevensentiteiten en respectievelijke gegevensentiteitattributen worden opgeslagen, waarbij de één of meer elektronische gegevensopslagen in communicatie staan met één of meer hardware computerprocessoren, waarbij de één of meer hardware computerprocessoren zijn ingericht met specifieke op een computer uitvoerbare instructies;het iteratief voortbrengen, voor elk van een veelheid van kiemgegevensentiteiten gekozen uit de veelheid van gegevensentiteiten, en door de één of meer hardware computerprocessoren, van een gegevensentiteitcluster door ten minste: het automatisch aanwijzen van de kiemgegevensentiteit als een initiële gegevensentiteit van de gegevensentiteitcluster;het benaderen, op basis van een clusterstrategie, van één of meer zoekprotocollen;het uitvoeren van ten minste een eerste van de één of meer zoekprotocollen op de één of meer elektronische gegevensopslagen om één of meer met de kiemgegevensentiteit geassocieerde gegevensentiteiten te identificeren, waarbij het uitvoeren van de eerste van de één of meer zoekprotocollen omvat: identificeren, door de één of meer hardware computerprocessoren, van ten minste één gegevensentiteitattribuut geassocieerd met de kiemgegevensentiteit;evalueren, door de één of meer hardware computerprocessoren, van de veelheid van gegevensentiteiten om de één of meer gegevensentiteiten te bepalen die de ten minste één gegevensentiteitattribuut delen met de kiemgegevensentiteit;het toevoegen van de één of meer gegevensentiteiten aan het gegevensentiteitcluster;het uitvoeren van ten minste een tweede van de één of meer zoekprofocollen op de één of meer elektronische gegevensopslagen om één of meer extra met de één of meer toegevoegde gegevensentiteiten geassocieerde gegevensentiteiten te identificeren, waarbij het uitvoeren van de tweede van de één of meer zoekprofocollen omvat: het identificeren, door de één of meer hardware computerprocessoren, van ten minste één gegevensentiteitattribuut, die geassocieerd is met ten minste één van de één of meer eerder aan het gegevensentiteitcluster toegevoegde gegevensentiteiten;en het evalueren, door de één of meer hardware computerprocessoren, van de veelheid van gegevensentiteiten om de één of meer extra gegevensentiteiten te bepalen die de ten minste één gegevensentiteitattribuut delen met de ten minste één van de één of meer eerder aan het gegevensentiteitcluster toegevoegde gegevensentiteiten;en toevoegen van de één of meer extra gegevensentiteiten aan het gegevensentiteitcluster.
  2. 2
    Werkwijze volgens conclusie 1, omvattende het automatisch selecteren van de kiemgegevensentiteit.
  3. 3
    Werkwijze volgens conclusie 1, omvattende het terughalen van de kiemgegevensentiteit in reactie op de selectie van de kiemgegevensentiteit door een gebruiker.
  4. 4
    Werkwijze volgens één van de voorgaande conclusie, bovendien omvattend:vergelijken, door de één of meer hardware computerprocessoren, van gegevensentiteiten geassocieerd met het gegevensentiteitcluster met gegevensentiteiten geassocieerd met een tweede gegevensentiteitcluster;en in reactie op het bepalen dat ten minste één gegevensentiteit geassocieerd met het gegevensentiteitcluster een attribuut deelt met en/of is gerelateerd aan ten minste één gegevensentiteit geassocieerd met het tweede gegevensentiteitcluster, samenvoegen van het gegevensentiteitcluster en het tweede gegevensentiteitcluster.
  5. 5
    Werkwijze volgens één van de voorgaande conclusie, waarbij de clusterstrategie één of meerdere zoekprofocollen omvat, en waarbij het vaststellen van één of meer extra gegevensentiteiten gerelateerd aan de kiemgegevensentiteit omvat:het uitvoeren van ten minste één zoekprotocol op de één of meer elektronische gegevensopslagen teneinde toegang te krijgen tot bepaalde gegevensentiteiten;en het evalueren van de bepaalde gegevensentiteiten die zijn teruggegeven door het ten minste één zoekprotocol teneinde één of meer extra gegevensentiteiten te identificeren voor opname in het gegevensentiteitcluster, waarbij de één of meer extra gegevensentiteiten het ten minste één gegevensent iteitattribuut delen met de kiemgegevens-entiteit.
  6. 6
    Werkwijze volgens conclusie 5, waarbij het ten minste één zoekprotocol de gegevensentiteitkiem gebruikt als een gegevensparameterinvoer voor het ten minste één zoekprotocol .
  7. 7
    Werkwijze volgens conclusie 5 of conclusie 6, waarbij een eerste zoekprotocol zoekt naar bepaalde gegevensentiteiten in een eerste elektronische gegevensopslag en een tweede zoekprotocol zoekt naar bepaalde gegevensentiteiten in een tweede elektronische gegevensopslag.
  8. 8
    Werkwijze volgens conclusie 7, waarbij het eerste zoekprotocol bepaalde gegevensentiteiten teruggeeft die worden gebruikt als gegevensparameterinvoeren voor het tweede zoekprotocol.
  9. 9
    Werkwijze volgens één van de conclusies 5 tot 8, bovendien omvattend:het identificeren, door de één of meer hardware computerprocessoren, van ten minste één andere gegevensentiteitattribuut geassocieerd met de één of meer extra gegevensentiteiten;het vaststellen, door de één of meer hardware computerprocessoren en op basis van de clusterstrategie en het van ten minste één andere gegevensentiteitattribuut, van één of meer tertiaire gegevensentiteiten gerelateerd aan de één of meer extra gegevensentiteiten;en het toevoegen, door de één of meer hardware computerprocessoren en op basis van de clusterstrategie, van de één of meer tertiaire gegevensentiteiten aan het gegevensentiteitcluster.
  10. 10
    Werkwijze volgens één van de conclusies 5 tot en met 9, bovendien omvattend:het toekennen van een rangschikscore aan het gegevensentiteitcluster, waarbij de rangschikscore wordt gebruikt om het gegevensentiteitcluster te ordenen ten opzichte van een veelheid van ander gegevensentiteitclusters voortgebracht vanuit betreffende gegevensentiteitkiemen volgens de clusterstrategie .
  11. 11
    Werkwijze volgens één van de voorgaande conclusies, waarbij de veelheid gegevensentiteiten betrekking hebben op financiële gegevens en ten minste één omvatten van:een rekeninggegevensentiteit, een transactiegegevensentiteit, een klantgegevensentiteit of een telefoonnummergegevensentiteit, waarbij de clusterstrategie is ingericht om gerelateerde gegevensentiteiten te identificeren voor het detecteren van mogelijke frauduleuze financiële activiteit, en waarbij het gegevensentiteitcluster geschikt is voor gebruik door een analist om verscheidene gegevensentiteiten vast te stellen die aan elkaar en aan mogelijke frauduleuze financiële activiteit zijn gerelateerd vast te stellen.
  12. 12
    Op een computer geïmplementeerde werkwijze voor het prioriteren van een veelheid gegevensentiteitclusters, waarbij de werkwijze omvat:communiceren met één of meer elektronische gegevensopslagen waarin een veelheid gegevensentiteiten en betreffende gegevensentiteitattributen worden opgeslagen, waarbij de één of meer elektronische gegevensopslagen in communicatie staan met één of meer hardware computerprocessoren, waarbij de één of meer hardware computerprocessoren zijn ingericht met specifieke door de computer uit te voeren instructies;voortbrengen, door de één of meer hardware computerprocessoren, van een veelheid gegevensentiteitclusters waarin in elk ervan een verzameling gerelateerde gegevensentiteiten wordt opgeslagen, waarbij elk van de gegevensentiteitclusters wordt voortgebracht door: het identificeren en toevoegen van een kiemgegevensentiteit aan het gegevensentiteitcluster;en bepalen en toevoegen aan het gegevensentiteitcluster, op basis van een clusterstrategie van één of meer extra gegevensentiteiten gerelateerd aan de kiemgegevensentiteit;identificeren, door de één of meer hardware computerprocessoren, van een scorestrategie voor het prioriteren van de veelheid gegevensentiteitclusters;voor elk gegevensentiteitcluster: evalueren, door de één of meer hardware computerprocessoren en op basis van de scorestrategie, van het gegevensentiteitcluster;en toewijzen, door de één of meer hardware computerprocessoren en op basis van de evaluatie, van een score aan het gegevensentiteitcluster;en rangschikken van de veelheid van gegevensentiteitclusters volgens de betreffende toegekende scores;waarbij het toewijzen van een score aan het gegevensentiteitcluster omvat: het vaststellen van een veelheid basisscores voor het gegevensentiteitcluster;het vaststellen, op basis van de veelheid basisscores, van een totaalscore voor het gegevensentiteitcluster;en het toekennen van de totaalscore aan het gegevensentiteitcluster.
  13. 13
    Werkwijze volgens conclusie 12, waarbij de aan elk gegevensentiteitcluster toegekende score overeenstemt met een mate van risico.
  14. 14
    Werkwijze volgens conclusies 12 of 13, bovendien omvattend:presenteren, op een door een gebruiker te bekijken elektronisch beeldscherm, van een opsomming en/of samenvatting van één of meer van de veelheid gegevensentiteitclusters volgens de rangschikking.
  15. 15
    Werkwijze volgens conclusie 14, waarbij de opsomming en/of samenvatting de kiemgegevensentiteit geassocieerd aan elk van de één of meer van de veelheid clusters presenteert.
  16. 16
    Werkwijze volgens één van de conclusies 12 tot en met 15, bovendien omvattend:identificeren van een tweede scorestrategie voor het prioriteren van de veelheid gegevensentiteitclusters;voor elk gegevensentiteitcluster: evalueren van één of meer attributen van de verzameling gerelateerde gegevensentiteiten opgeslagen door het gegevensentiteitcluster volgens de tweede scorestrategie;en toewijzen van een tweede score aan het gegevensentiteitcluster;het herrangschikken van de veelheid van gegevensentiteitclusters volgens de betreffende toegekende tweede scores;en presenteren, op een door een gebruiker te bekijken elektronisch beeldscherm, van een opsomming en/of samenvatting van één of meer van de veelheid gegevensentiteitclusters volgens de herrangschikking.
  17. 17
    Werkwijze volgens één van de conclusies 12 tot en met 16, waarbij de veelheid gegevensentiteiten betrekking hebben op financiële gegevens en ten minste één omvatten van:een rekeninggegevensentiteit, een transactiegegevensentiteit, een klantgegevensentiteit of een telefoonnummergegevensentiteit, waarbij de clusterstrategie is ingericht om gerelateerde gegevensentiteiten te identificeren voor het detecteren van mogelijke frauduleuze financiële activiteit, 5 en waarbij het gegevensentiteitcluster geschikt is voor gebruik door een analist om verscheidene aan elkaar en aan mogelijke frauduleuze financiële activiteit gerelateerde gegevensent iteiten vast te stellen.
  18. 18
    Computerprogramma omvattende door een machine 10 leesbare instructies die, wanneer deze door een computer worden uitgevoerd, deze besturen om de werkwijze volgens één van de voorgaande conclusies te realiseren.
  19. 19
    Inrichting ingericht om de werkwijze volgens één van de conclusies 1 tot en met 17 uit te voeren. 1/10
Independent claims19